<link rel="stylesheet" href="styles.f3b1fba60ec7970c.css">

Deep learning architectures for multiclass clothing recognition as the semantic core of automated virtual try-on systems

Анотація

W niniejszym artykule przeanalizowano i uzasadniono wybór architektur uczenia głębokiego do wieloklasowej klasyfikacji odzieży zintegrowanej z systemami wirtualnego przymierzania (VTO). Przeprowadzono systematyczne porównanie modeli ResNet-50, EfficientNet-B4 oraz Vision Transformer (ViT-B/16) na zbiorach danych DeepFashion2 i ModaNet. Model ViT-B/16 osiągnął najwyższą dokładność wynoszącą 92,4% w klasyfikacji Top-1 na zbiorze DeepFashion2 oraz 88,9% na zbiorze ModaNet, wykazując średni spadek dokładności między zbiorami danych wynoszący 3,9 punktu procentowego, co stanowi najmniejszy spadek spośród ocenianych modeli. Wstępna segmentacja U2-Net statystycznie istotnie poprawiła wskaźnik macro-F1 dla wszystkich architektur (p < 0,001), przynosząc średni wzrost o 3,2 punktu procentowego oraz zmniejszenie luki między domeną studyjną a uliczną z 11 do 6 punktów procentowych. EfficientNet-B4 zapewnił optymalny stosunek dokładności do opóźnienia, osiągając 87% dokładności Top-1 przy 60 klatkach na sekundę na sprzęcie konsumenckim (RTX 3060), podczas gdy ViT-B/16 wymagał optymalizacji, aby utrzymać 45 klatek na sekundę. Zalecana strategia dla przemysłowych systemów VTO łączy segmentację U2-Net z wyborem architektury opartym na możliwościach platformy docelowej, zapewniając równowagę między wiernością wizualną a wydajnością obliczeniową.
This article examines and substantiates the choice of deep learning architectures for multiclass clothing classification integrated into virtual try-on (VTO) systems. Systematically compared ResNet-50, EfficientNet-B4, and Vision Transformer (ViT-B/16) on DeepFashion2 and ModaNet datasets. ViT-B/16 achieved the highest accuracy of 92.4% Top-1 on DeepFashion2 and 88.9% on ModaNet, demonstrating an average cross-dataset accuracy drop of 3.9 percentage points, the smallest among evaluated models. Preliminary U2-Net segmentation statistically significantly improved macro-F1 for all architectures (p < 0.001), with an average gain of 3.2 percentage points and reduction of the studio-to-street domain gap 11 to 6 percentage points. EfficientNet-B4 provided the optimal accuracy-to-latency ratio, achieving 87% Top-1 accuracy at 60 FPS on consumer hardware (RTX 3060), while ViT-B/16 required optimization to maintain 45 FPS. The recommended strategy for industrial VTO systems combines U2-Net segmentation with architecture ion based on target platform capabilities, balancing visual fidelity and computational efficiency.

Опис

УДК

Тип документа

Мова

Бібліографічний опис

Chekhmestruk R., Voitsekhovska O., Kyrylashchuk S. Deep learning architectures for multiclass clothing recognition as the semantic core of automated virtual try-on systems // Informatyka Automatyka Pomiary w Gospodarce i Ochronie Środowiska. 2026. Vol. 16, іss. 2. P. 162-172. URI: https://ph.pollub.pl/index.php/iapgos/en/article/view/7957/5508.

Схвалення

Рецензія

Доповнено

Цитується в