Нейромережевий метод розпізнавання емоційного стану мовлення в системах контакт-центрів на основі архітектури CNN-BiLSTM з модифікованим механізмом уваги
Автор
Овчаренко, М. А.
Каштан, В. Ю.
Ovcharenko, M. A.
Kashtan, V. Yu.
Дата
2026Metadata
Показати повну інформаціюCollections
- JetIQ [100]
Анотації
The relevance of this research lies in the need to improve the efficiency of decision-support systems in contact centers for automated analysis of the emotional states of operators and clients. Detecting emotional tension in the voice enables timely adjustments to interactions, enhancing service quality and operator performance. Traditional audio signal processing methods based on Mel-Frequency Cepstral Coefficients (MFCCs) have limitations in preserving complete acoustic information, thereby reducing the accuracy of emotion recognition. This work proposes a neural network method that combines Convolutional Neural Networks (CNNs) and Bidirectional Long Short-Term Memory (BiLSTM) networks with a modified Attention mechanism. The first stage involves loading a Ukrainian-language audio dataset and performing preliminary data processing, including amplitude normalization, noise filtering, speech segmentation, conversion to Mel-spectrograms, and extraction of low-level descriptors (LLD), such as energy and fundamental frequency (F0). The input data are formed into fixed-dimension tensors for neural network analysis. During the feature extraction stage, the CNN automatically identifies local spectral characteristics of the signal, including intensity, frequency components, and intonational peaks. Each convolutional block is complemented with batch normalization to stabilize training and accelerate convergence. To model the temporal dynamics of the emotional state, bidirectional BiLSTM layers are applied, taking into account the context of preceding and subsequent signal segments. The Attention mechanism forms a context vector as a weighted sum of features, determining the relative importance of individual time frames, and then passes it to a fully connected layer with a tanh activation function. In this work, the modified Attention mechanism refers to the integration of audio recording metadata (signal duration, 640 kbps bitrate, technical identifiers) into the formation of the context vector via a Multi-Weighting System (MWS). It allows simultaneous consideration of local spectral features, temporal dynamics of the audio signal, and the relevance of individual speech segments. The scientific novelty lies in the development of a neural network method that combines CNN–BiLSTM–Attention with a multimodal weighting mechanism, integrating audio metadata into the formation of the context vector. This architecture provides increased accuracy in recognizing emotional tension. A comparative analysis of traditional MFCC and LLD was conducted, demonstrating the advantage of LLD: the baseline CNN accuracy increased 82,42 % to 9,.00 %, and integrating the Attention layer further improved accuracy by 1.5...2%. The highest achieved accuracy was 93,48%. Актуальність дослідження зумовлена необхідністю підвищення ефективності систем підтримки прийняття рішень у контакт-центрах для автоматизованого аналізу емоційного стану мовлення операторів і клієнтів. Визначення емоційної напруженості у голосі дозволяє своєчасно коригувати взаємодію, підвищувати якість обслуговування та ефективність роботи операторів. Традиційні методи обробки аудіосигналів, що базуються на мел-частотних кепстральних коефіцієнтах (MFCC), мають обмеження щодо збереження повної акустичної інформації, що знижує точність розпізнавання емоцій. У роботі запропоновано нейромережевий метод, який поєднує згорткові нейронні мережі (CNN) та двонаправлені мережі довгострокової короткочасної пам’яті (BiLSTM) з модифікованим механізмом уваги (Attention). Першим етапом здійснено завантаження українськомовного аудіонабору та попередню обробку даних, що включає нормалізацію амплітуди, фільтрацію шумів, сегментацію мовлення, перетворення у мел-спектрограму та вилучення низькорівневих дескрипторів (LLD), таких як енергія і частота основного тону. Вхідні дані формуються у тензори фіксованої розмірності для нейромережевого аналізу. На етапі вилучення ознак CNN автоматично визначає локальні спектральні характеристики сигналу, включно з інтенсивністю, частотними компонентами та інтонаційними сплесками. Кожен згортковий блок доповнено пакетною нормалізацією для стабільного навчання та пришвидшення збіжності. Для моделювання часової динаміки емоційного стану застосовано двонапрямлені шари BiLSTM, що враховують контекст попередніх і наступних фрагментів сигналу. Механізм уваги формує контекстний вектор як зважену суму ознак, визначаючи відносну значущість окремих часових кадрів, який передається до повнозв’язного шару з функцією активації tanh. Модифікований механізм уваги у цій роботі означає інтеграцію метаданих аудіозапису (тривалість сигналу, бітрейт 640 кбіт/с, технічні ідентифікатори) у процес формування контекстного вектору через систему мультимодального зважування (MWS). Це дозволяє одночасно враховувати локальні спектральні ознаки, часову динаміку аудіосигналу та релевантність окремих фрагментів мовлення. Наукова новизна полягає у розробленні нейромережевого методу, що поєднує CNN–BiLSTM–Attention з механізмом мультимодального зважування, який інтегрує метадані аудіозапису у формування контекстного вектора. Така архітектура забезпечує підвищену точність розпізнавання емоційної напруженості. Проведено порівняльний аналіз традиційних MFCC та LLD, який показав перевагу LLD: базова точність CNN зросла з 82,42 % до 91,00 %, а інтеграція шару Attention додатково підвищила точність на 1,5...2 %. Найвищий результат 93,48 % досягнуто у разі поєднання CNN-BiLSTM-Attention з багатомодальною системою зважування та ознаками LLD.
URI:
https://ir.lib.vntu.edu.ua//handle/123456789/52342

