| dc.contributor.author | Chekhmestruk, R. | en |
| dc.contributor.author | Voitsekhovska, О. | en |
| dc.contributor.author | Kyrylashchuk, S. | en |
| dc.contributor.author | Чехместрук, Р. Ю. | en |
| dc.contributor.author | Войцеховська, О. В. | en |
| dc.contributor.author | Кирилащук, С. А. | en |
| dc.date.accessioned | 2026-09-14T11:57:36Z | |
| dc.date.available | 2026-09-14T11:57:36Z | |
| dc.date.issued | 2026 | en |
| dc.identifier.citation | Chekhmestruk R., Voitsekhovska O., Kyrylashchuk S. Deep learning architectures for multiclass clothing recognition as the semantic core of automated virtual try-on systems // Informatyka Automatyka Pomiary w Gospodarce i Ochronie Środowiska. 2026. Vol. 16, іss. 2. P. 162-172. URI: https://ph.pollub.pl/index.php/iapgos/en/article/view/7957/5508. | en |
| dc.identifier.issn | 2083-0157 | en |
| dc.identifier.uri | https://ir.lib.vntu.edu.ua/handle/123456789/54390 | |
| dc.description.abstract | W niniejszym artykule przeanalizowano i uzasadniono wybór architektur uczenia głębokiego do wieloklasowej klasyfikacji odzieży
zintegrowanej z systemami wirtualnego przymierzania (VTO). Przeprowadzono systematyczne porównanie modeli ResNet-50, EfficientNet-B4 oraz Vision
Transformer (ViT-B/16) na zbiorach danych DeepFashion2 i ModaNet. Model ViT-B/16 osiągnął najwyższą dokładność wynoszącą 92,4% w klasyfikacji
Top-1 na zbiorze DeepFashion2 oraz 88,9% na zbiorze ModaNet, wykazując średni spadek dokładności między zbiorami danych wynoszący 3,9 punktu
procentowego, co stanowi najmniejszy spadek spośród ocenianych modeli. Wstępna segmentacja U2-Net statystycznie istotnie poprawiła wskaźnik
macro-F1 dla wszystkich architektur (p < 0,001), przynosząc średni wzrost o 3,2 punktu procentowego oraz zmniejszenie luki między domeną studyjną
a uliczną z 11 do 6 punktów procentowych. EfficientNet-B4 zapewnił optymalny stosunek dokładności do opóźnienia, osiągając 87% dokładności Top-1
przy 60 klatkach na sekundę na sprzęcie konsumenckim (RTX 3060), podczas gdy ViT-B/16 wymagał optymalizacji, aby utrzymać 45 klatek na sekundę.
Zalecana strategia dla przemysłowych systemów VTO łączy segmentację U2-Net z wyborem architektury opartym na możliwościach platformy docelowej,
zapewniając równowagę między wiernością wizualną a wydajnością obliczeniową. | en_US |
| dc.description.abstract | This article examines and substantiates the choice of deep learning architectures for multiclass clothing classification integrated into virtual try-on (VTO) systems. Systematically compared ResNet-50, EfficientNet-B4, and Vision Transformer (ViT-B/16) on DeepFashion2 and ModaNet datasets. ViT-B/16 achieved the highest accuracy of 92.4% Top-1 on DeepFashion2 and 88.9% on ModaNet, demonstrating an average cross-dataset accuracy drop of 3.9 percentage points, the smallest among evaluated models. Preliminary U2-Net segmentation statistically significantly improved macro-F1 for all architectures (p < 0.001), with an average gain of 3.2 percentage points and reduction of the studio-to-street domain gap 11 to 6 percentage points. EfficientNet-B4 provided the optimal accuracy-to-latency ratio, achieving 87% Top-1 accuracy at 60 FPS on consumer hardware (RTX 3060), while ViT-B/16 required optimization to maintain 45 FPS. The recommended strategy for industrial VTO systems combines U2-Net segmentation with architecture ion based on target platform capabilities, balancing visual fidelity and computational efficiency. | uk_UA |
| dc.language.iso | en_US | en_US |
| dc.publisher | Politechnika Lubelska | en |
| dc.relation.ispartof | Informatyka Automatyka Pomiary w Gospodarce i Ochronie Środowiska. Vol. 16, іss. 2 : 162-172. | en |
| dc.subject | VTO-systems | en |
| dc.subject | segmentation | en |
| dc.subject | CNN | en |
| dc.subject | DeepFashion | en |
| dc.subject | vision transformer | en |
| dc.subject | online shopping | en |
| dc.subject | systemy VTO | en |
| dc.subject | segmentacja | en |
| dc.subject | CNN | en |
| dc.subject | DeepFashion | en |
| dc.subject | vision transformer | en |
| dc.subject | zakupy online | en |
| dc.title | Deep learning architectures for multiclass clothing recognition as the semantic core of automated virtual try-on systems | en |
| dc.title.alternative | Architektury uczenia głębokiego do rozpoznawania odzieży różnorodnych kategorii jako semantyczny trzon automatycznych systemów wirtualnego przymierzania | en_US |
| dc.type | Article, Scopus-WoS | |
| dc.relation.references | https://ph.pollub.pl/index.php/iapgos/en/article/view/7957/5508 | en |
| dc.identifier.doi | https://doi.org/10.35784/iapgos.7957 | en |
| dc.identifier.orcid | https://orcid.org/0000-0002-5362-8796 | en |
| dc.identifier.orcid | https://orcid.org/0000-0001-8755-1574 | en |
| dc.identifier.orcid | https://orcid.org/0000-0002-8972-3541 | en |