| dc.contributor.author | Овчаренко, М. А. | uk |
| dc.contributor.author | Каштан, В. Ю. | uk |
| dc.contributor.author | Ovcharenko, M. A. | en |
| dc.contributor.author | Kashtan, V. Yu. | en |
| dc.date.accessioned | 2026-08-20T09:33:12Z | |
| dc.date.available | 2026-08-20T09:33:12Z | |
| dc.date.issued | 2026 | |
| dc.identifier.citation | Овчаренко М. А., Каштан В. Ю. Нейромережевий метод розпізнавання емоційного стану мовлення в системах контакт-центрів на основі архітектури CNN-BiLSTM з модифікованим механізмом уваги // Вісник Вінницького політехнічного інституту. 2026. № 3. С. 52-60. URI: https://visnyk.vntu.edu.ua/index.php/visnyk/article/view/3514. | uk |
| dc.identifier.issn | 1997-9274 | |
| dc.identifier.uri | https://ir.lib.vntu.edu.ua//handle/123456789/52342 | |
| dc.description.abstract | The relevance of this research lies in the need to improve the efficiency of decision-support systems in contact centers for automated analysis of the emotional states of operators and clients. Detecting emotional tension in the voice enables timely adjustments to interactions, enhancing service quality and operator performance. Traditional audio signal processing methods based on Mel-Frequency Cepstral Coefficients (MFCCs) have limitations in preserving complete acoustic information, thereby reducing the accuracy of emotion recognition. This work proposes a neural network method that combines Convolutional Neural Networks (CNNs) and Bidirectional Long Short-Term Memory (BiLSTM) networks with a modified Attention mechanism. The first stage involves loading a Ukrainian-language audio dataset and performing preliminary data processing, including amplitude normalization, noise filtering, speech segmentation, conversion to Mel-spectrograms, and extraction of low-level descriptors (LLD), such as energy and fundamental frequency (F0). The input data are formed into fixed-dimension tensors for neural network analysis. During the feature extraction stage, the CNN automatically identifies local spectral characteristics of the signal, including intensity, frequency components, and intonational peaks. Each convolutional block is complemented with batch normalization to stabilize training and accelerate convergence. To model the temporal dynamics of the emotional state, bidirectional BiLSTM layers are applied, taking into account the context of preceding and subsequent signal segments. The Attention mechanism forms a context vector as a weighted sum of features, determining the relative importance of individual time frames, and then passes it to a fully connected layer with a tanh activation function. In this work, the modified Attention mechanism refers to the integration of audio recording metadata (signal duration, 640 kbps bitrate, technical identifiers) into the formation of the context vector via a Multi-Weighting System (MWS). It allows simultaneous consideration of local spectral features, temporal dynamics of the audio signal, and the relevance of individual speech segments. The scientific novelty lies in the development of a neural network method that combines CNN–BiLSTM–Attention with a multimodal weighting mechanism, integrating audio metadata into the formation of the context vector. This architecture provides increased accuracy in recognizing emotional tension. A comparative analysis of traditional MFCC and LLD was conducted, demonstrating the advantage of LLD: the baseline CNN accuracy increased 82,42 % to 9,.00 %, and integrating the Attention layer further improved accuracy by 1.5...2%. The highest achieved accuracy was 93,48%. | en |
| dc.description.abstract | Актуальність дослідження зумовлена необхідністю підвищення ефективності систем підтримки прийняття рішень у контакт-центрах для автоматизованого аналізу емоційного стану мовлення операторів і клієнтів. Визначення емоційної напруженості у голосі дозволяє своєчасно коригувати взаємодію, підвищувати якість обслуговування та ефективність роботи операторів. Традиційні методи обробки аудіосигналів, що базуються на мел-частотних кепстральних коефіцієнтах (MFCC), мають обмеження щодо збереження повної акустичної інформації, що знижує точність розпізнавання емоцій. У роботі запропоновано нейромережевий метод, який поєднує згорткові нейронні мережі (CNN) та двонаправлені мережі довгострокової короткочасної пам’яті (BiLSTM) з модифікованим механізмом уваги (Attention). Першим етапом здійснено завантаження українськомовного аудіонабору та попередню обробку даних, що включає нормалізацію амплітуди, фільтрацію шумів, сегментацію мовлення, перетворення у мел-спектрограму та вилучення низькорівневих дескрипторів (LLD), таких як енергія і частота основного тону. Вхідні дані формуються у тензори фіксованої розмірності для нейромережевого аналізу. На етапі вилучення ознак CNN автоматично визначає локальні спектральні характеристики сигналу, включно з інтенсивністю, частотними компонентами та інтонаційними сплесками. Кожен згортковий блок доповнено пакетною нормалізацією для стабільного навчання та пришвидшення збіжності. Для моделювання часової динаміки емоційного стану застосовано двонапрямлені шари BiLSTM, що враховують контекст попередніх і наступних фрагментів сигналу. Механізм уваги формує контекстний вектор як зважену суму ознак, визначаючи відносну значущість окремих часових кадрів, який передається до повнозв’язного шару з функцією активації tanh. Модифікований механізм уваги у цій роботі означає інтеграцію метаданих аудіозапису (тривалість сигналу, бітрейт 640 кбіт/с, технічні ідентифікатори) у процес формування контекстного вектору через систему мультимодального зважування (MWS). Це дозволяє одночасно враховувати локальні спектральні ознаки, часову динаміку аудіосигналу та релевантність окремих фрагментів мовлення. Наукова новизна полягає у розробленні нейромережевого методу, що поєднує CNN–BiLSTM–Attention з механізмом мультимодального зважування, який інтегрує метадані аудіозапису у формування контекстного вектора. Така архітектура забезпечує підвищену точність розпізнавання емоційної напруженості. Проведено порівняльний аналіз традиційних MFCC та LLD, який показав перевагу LLD: базова точність CNN зросла з 82,42 % до 91,00 %, а інтеграція шару Attention додатково підвищила точність на 1,5...2 %. Найвищий результат 93,48 % досягнуто у разі поєднання CNN-BiLSTM-Attention з багатомодальною системою зважування та ознаками LLD. | uk |
| dc.language.iso | uk_UA | uk_UA |
| dc.publisher | ВНТУ | uk |
| dc.relation.ispartof | Вісник Вінницького політехнічного інституту. № 3 : 52-60. | uk |
| dc.relation.uri | https://visnyk.vntu.edu.ua/index.php/visnyk/article/view/3514 | |
| dc.subject | розпізнавання емоцій мовлення | uk |
| dc.subject | згорткові нейронні мережі | uk |
| dc.subject | двонаправлені мережі довгострокової короткочасної пам’яті | uk |
| dc.subject | мультимодальне зважування | uk |
| dc.subject | аудіоаналіз | uk |
| dc.subject | speech emotion recognition | en |
| dc.subject | convolutional neural networks | en |
| dc.subject | bidirectional long-term memory networks | en |
| dc.subject | multimodal weighting | en |
| dc.subject | audio analysis | en |
| dc.title | Нейромережевий метод розпізнавання емоційного стану мовлення в системах контакт-центрів на основі архітектури CNN-BiLSTM з модифікованим механізмом уваги | uk |
| dc.title.alternative | Neural Network Method for Emotion Speech State Recognition in Contact Centre Systems Based on CNN-BiLSTM Architecture with a Modified Attention Mechanism | en |
| dc.type | Article, professional native edition | |
| dc.type | Article | |
| dc.identifier.udc | 004.9 | |
| dc.relation.references | N. Dhanpat, F. D. Modau, P. Lugisani, R. Mabojane, and M. Phiri, “Exploring employee retention and intention to leave within a call center,” SA J. Hum. Resour. Manag., vol. 16, pp. 1-13, 2018.[Online]. Available: https://www.researchgate.net/publication/323869688_Exploring_employee_retention_and_intention_to_leave_within_a_call_centre . | en |
| dc.relation.references | B. Karakus, and G. Aydin, “Call center performance evaluation using big data analytics,” in Proc. 2016 International Symposium on Networks, Computers and Communications (ISNCC), Hammamet, Tunisia, 2016, pp. 1-6 . https://doi.org/10.1109/ISNCC.2016.7746116. | en |
| dc.relation.references | J. Cho, R. Pappagari, P. Kulkarni, J. Villalba, Y. Carmiel, and N. Dehak, “Deep neural networks for emotion recognition combining audio and transcripts,” arXiv preprint arXiv:1911.00432, 2019. https://doi.org/10.21437/Interspeech.2018-2466. | en |
| dc.relation.references | X. Liu, J. van de Weijer, and A. D. Bagdanov, “Exploiting unlabeled data in cnns by self-supervised learning to rank,” IEEE Trans. Pattern Anal. Mach. Intell., vol. 41, pp. 1862-1878, 2019, https://doi.org/10.48550/arXiv.1902.06285. | en |
| dc.relation.references | F. Karim, S. Majumdar, and H. Darabi, “Insights into LSTM fully convolutional networks for time series classification,” IEEE Access, vol. 7, pp. 67718-67725, 2019, https://doi.org/10.1109/ACCESS.2019.2916828. | en |
| dc.relation.references | N. Shabrina, F. Kasyidi, and R. Ilyas, “A BiLSTM-Based Approach for Speech Emotion Recognition in Conversational Indonesian Audio using SMOTE,” Jurnal Teknik Informatika (Jutif), vol. 6, pp. 3173-3187, 2025, https://doi.org/10.52436/1.jutif.2025.6.5.5183. | en |
| dc.relation.references | S. Ayadi, and Z. Lachiri, “A combined CNN-LSTM Network for Audio Emotion Recognition using Speech and Song at-tributs,” in Proc. 2022 6th International Conference on Advanced Technologies for Signal and Image Processing (ATSIP), Sfax, Tunisia, 2022, pp. 1-6, https://doi.org/10.1109/ATSIP55956.2022.9805924. | en |
| dc.relation.references | A. Ahmed, S. Toral, K. Shaalan, and Y. Hifny, “Agent Productivity Modeling in a Call Center Domain Using Attentive Convolutional Neural Networks,” Sensors, vol. 20, p. 5489, 2020, https://doi.org/10.3390/s20195489. | en |
| dc.relation.references | В. Гнатушенко, В. Каштан, А. Іванько, іМ. Овчаренко, «Аналіз неструктурованих даних контакт-центру для підтримки прийняття рішень,» Електротехнічні та інформаційні системи, No 106, с. 80-86, 2024,https://doi.org/10.32782/EIS/2024-106-14. | uk |
| dc.relation.references | A. Norouzian, B. Mazoure, D. Connolly, and D. Willett, “Exploring attention mechanism for acoustic-based classification of speech utterances into system-directed and non-system-directed,” in Proc. ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Brighton, UK, 2019, pp. 7310-7314, https://doi.org/10.48550/arXiv.1902.00570. | en |
| dc.relation.references | L. Shu, J. Xie, M. Yang, Z. Li, Z. Li, D. Liao, X. Xu, and X. Yang, “A review of emotion recognition using physiologi-cal signals,” Sensors, vol. 18, p. 2074, 2018, https://doi.org/10.3390/s18072074. | en |
| dc.relation.references | T. Anvarjon, Mustaqeem, and S. Kwon, “Deep-Net: A Lightweight CNN-Based Speech Emotion Recognition System Using Deep Frequency Features,” Sensors, vol. 20, p. 5212, 2020, https://doi.org/10.3390/s20185212. | en |
| dc.identifier.doi | https://doi.org/10.31649/1997-9266-2026-186-3-52-60 | |
| dc.identifier.orcid | https://orcid.org/0009-0006-0730-0913 | |
| dc.identifier.orcid | https://orcid.org/0000-0002-0395-5895 | |