• українська
    • English
  • українська 
    • українська
    • English
  • Увійти
Дивитися документ 
  • Головна
  • Науково-технічна бібліотека
  • Публікації співробітників бібліотеки
  • JetIQ
  • Дивитися документ
  • Головна
  • Науково-технічна бібліотека
  • Публікації співробітників бібліотеки
  • JetIQ
  • Дивитися документ
Сайт інституційного репозитарію ВНТУ містить роботи, матеріали та файли, які були розміщені докторантами, аспірантами та студентами Вінницького Національного Технічного Університету. Для розширення функцій сайту рекомендується увімкнути JavaScript.

Deep learning architectures for multiclass clothing recognition as the semantic core of automated virtual try-on systems

Автор
Chekhmestruk, R.
Voitsekhovska, О.
Kyrylashchuk, S.
Чехместрук, Р. Ю.
Войцеховська, О. В.
Кирилащук, С. А.
Дата
2026
Metadata
Показати повну інформацію
Collections
  • JetIQ [20]
Анотації
W niniejszym artykule przeanalizowano i uzasadniono wybór architektur uczenia głębokiego do wieloklasowej klasyfikacji odzieży zintegrowanej z systemami wirtualnego przymierzania (VTO). Przeprowadzono systematyczne porównanie modeli ResNet-50, EfficientNet-B4 oraz Vision Transformer (ViT-B/16) na zbiorach danych DeepFashion2 i ModaNet. Model ViT-B/16 osiągnął najwyższą dokładność wynoszącą 92,4% w klasyfikacji Top-1 na zbiorze DeepFashion2 oraz 88,9% na zbiorze ModaNet, wykazując średni spadek dokładności między zbiorami danych wynoszący 3,9 punktu procentowego, co stanowi najmniejszy spadek spośród ocenianych modeli. Wstępna segmentacja U2-Net statystycznie istotnie poprawiła wskaźnik macro-F1 dla wszystkich architektur (p < 0,001), przynosząc średni wzrost o 3,2 punktu procentowego oraz zmniejszenie luki między domeną studyjną a uliczną z 11 do 6 punktów procentowych. EfficientNet-B4 zapewnił optymalny stosunek dokładności do opóźnienia, osiągając 87% dokładności Top-1 przy 60 klatkach na sekundę na sprzęcie konsumenckim (RTX 3060), podczas gdy ViT-B/16 wymagał optymalizacji, aby utrzymać 45 klatek na sekundę. Zalecana strategia dla przemysłowych systemów VTO łączy segmentację U2-Net z wyborem architektury opartym na możliwościach platformy docelowej, zapewniając równowagę między wiernością wizualną a wydajnością obliczeniową.
 
This article examines and substantiates the choice of deep learning architectures for multiclass clothing classification integrated into virtual try-on (VTO) systems. Systematically compared ResNet-50, EfficientNet-B4, and Vision Transformer (ViT-B/16) on DeepFashion2 and ModaNet datasets. ViT-B/16 achieved the highest accuracy of 92.4% Top-1 on DeepFashion2 and 88.9% on ModaNet, demonstrating an average cross-dataset accuracy drop of 3.9 percentage points, the smallest among evaluated models. Preliminary U2-Net segmentation statistically significantly improved macro-F1 for all architectures (p < 0.001), with an average gain of 3.2 percentage points and reduction of the studio-to-street domain gap 11 to 6 percentage points. EfficientNet-B4 provided the optimal accuracy-to-latency ratio, achieving 87% Top-1 accuracy at 60 FPS on consumer hardware (RTX 3060), while ViT-B/16 required optimization to maintain 45 FPS. The recommended strategy for industrial VTO systems combines U2-Net segmentation with architecture ion based on target platform capabilities, balancing visual fidelity and computational efficiency.
 
URI:
https://ir.lib.vntu.edu.ua/handle/123456789/54390
Відкрити
iapgos.7957.pdf (1.379Mb)

Інституційний репозиторій

ГоловнаПошукДовідкаКонтактиПро нас

Ресурси

JetIQСайт бібліотекиСайт університетаЕлектронний каталог ВНТУ

Перегляд

Всі архівиСпільноти та колекціїЗа датою публікаціїАвторамиНазвамиТемамиТипВидавництвоМоваУДКISSNВидання, що міститьDOIЦя колекціяЗа датою публікаціїАвторамиНазвамиТемамиТипВидавництвоМоваУДКISSNВидання, що міститьDOI

Мій обліковий запис

Вхід

ISSN 2413-6360 | Головна | Відправити відгук | Довідка | Контакти | Про нас
© 2016 Vinnytsia National Technical University | Extra plugins code by VNTU Linuxoids | Powered by DSpace
Працює за підтримки 
НТБ ВНТУ