Software implementation of a network traffic monitoring system based on cluster analysis
Автор
Budzhelida, S.
Dubrovin, V.
Deineha, L.
Буджеліда, С.
Дубровін, В.
Дейнега, Л.
Дата
2026Metadata
Показати повну інформаціюCollections
Анотації
The growth in the volume and heterogeneity of network traffic complicates the timely detection of attacks, as signature-based approaches do not cover new or modified threats. Interpretable and reproducible methods for analysing data flows are needed, and they must be suitable for integration into monitoring systems. The purpose of the study was to develop and implement a monitoring system that separates normal connections anomalous ones without prior data labelling and provides transparent decision-making criteria. The research methodology was based on the standardisation of network traffic features and the use of the unsupervised k-means clustering algorithm, followed by anomaly detection through deviations centroids. On a synthetic set of events with a small proportion of violations, the system consistently formed two compact clusters corresponding to typical and atypical behaviour. The centroid of normal traffic was characterised by lower values for the volumes of transmitted and received data and lower connection activity; the centroid of anomalous traffic had substantially higher values across all features. The combined post-clustering rule reduced false positives that arise during legitimate large transfers, for example, backups, while maintaining a high proportion of correctly detected rare events. Comparative experiments demonstrated comparable or higher precision and recall than classical outlier detection approaches, along with a stable millisecond-level processing time for one thousand records. The sensitivity analysis confirmed robustness to the choice of distance threshold and preprocessing parameters. The experimental sample contained 1,000 records, of which 980 corresponded to normal network traffic and 20 corresponded to anomalous events (2%). Clustering formed two clusters, with the smaller cluster grouping 20 records that corresponded to atypical network behaviour. The proposed approach does not require reference labels, scales easily, provides transparent explanations through centroids and distances, is suitable for batch and stream processing, and can serve as a basic component in production anomaly detection pipelines. Зростання обсягів і різнорідності мережевого трафіку ускладнює своєчасне виявлення атак, тоді як підходи, що ґрунтуються на сигнатурах, не охоплюють нові або модифіковані загрози. Потрібні інтерпретовані й відтворювані методи аналізу потоків даних, придатні для інтеграції в моніторингові системи. Метою дослідження було розробити та програмно реалізувати систему моніторингу, яка без попереднього розмічування даних відокремлює нормальні з’єднання від аномальних та надає прозорі критерії прийняття рішень. Методологія дослідження ґрунтувалася на стандартизації ознак мережевого трафіку та застосуванні алгоритму неконтрольованої кластеризації k-means з подальшим виявленням аномалій за відхиленням від центроїдів. На синтетичному наборі подій із невеликою часткою порушень система стабільно формувала два компактні кластери, що відповідали типовій та нетиповій поведінці. Центроїд нормального трафіку характеризувалося меншими значеннями обсягів переданих і прийнятих даних, а також нижчою активністю з’єднань; центроїд аномального – істотно вищими показниками за всіма ознаками. Комбіноване правило після кластеризації зменшувало хибні спрацювання, які виникають під час легітимних великих передавань (наприклад, резервних копій), і водночас утримує високу частку правильно виявлених рідкісних подій. Порівняльні експерименти демонструвало співставну або кращу точність і повноту щодо класичних підходів до виявлення викидів, а також стабільний час обробки на рівні мілісекунд для тисячі записів. Аналіз чутливості підтвердив стійкість до вибору порога відстані та параметрів попередньої обробки. Експериментальна вибірка містила 1 000 записів, з яких 980 відповідали нормальному мережевому трафіку, а 20 – аномальним подіям (2 %). У результаті кластеризації сформовано два кластери, причому менший кластер об’єднав 20 записів, що відповідають нетиповій поведінці мережі. Запропонований підхід не потребує еталонних міток, легко масштабується, забезпечує прозорі пояснення через центроїди та відстані, придатний для пакетної та потокової обробки й може слугувати базовою ланкою у виробничих конвеєрах виявлення аномалій.
URI:
https://ir.lib.vntu.edu.ua//handle/123456789/52351

