Show simple item record

dc.contributor.authorКозлов, С. Л.uk
dc.contributor.authorКолесницький, О. К.uk
dc.contributor.authorKozlov, S. L.uk
dc.contributor.authorKolesnytskyi, O. K.uk
dc.date.accessioned2026-08-27T13:42:52Z
dc.date.available2026-08-27T13:42:52Z
dc.date.issued2026uk
dc.identifier.citationКозлов С. Л., Колесницький О. К. Ефективні дифузійні моделі для SUPER-RESOLUTION зображень // Наукові праці Вінницького національного технічного університету. Електрон. текст. дані (PDF: 524 КБ). 2026. № 1. URI: https://praci.vntu.edu.ua/index.php/praci/article/view/944.uk
dc.identifier.issn2307-5376uk
dc.identifier.urihttps://ir.lib.vntu.edu.ua//handle/123456789/52418
dc.description.abstractДифузійні моделі встановили нові стандарти перцептивної якості у SISR, проте їхнє багатокрокове висновування та великий розмір моделі складнюють практичне розгортання: моделі на основі Stable Diffusion потребують 50–200 кроків знешумлення, секундні затримки та мільярди параметрів. Цей гляд систематизує два взаємодоповнюючі напрямки: ефективне проєктування дифузійного процесу, що скорочує ітеративне семплювання від сотень кроків до кількох, та ущільнення моделей для розгортання з обмеженими ресурсами. Проаналізовано дванадцять моделей 2023–2025 років: вісім ефективних(ResShift, SinSR, OSEDiff, TSD-SR, AddSR, DoSSR, CCSR, InvSR) та чотири ущільнених (AdcSR, PassionSR, Edge-SD-SR, BiMaCoSR), та проведено порівняння їх за якістю (SSIM, LPIPS, CLIPIQA, MUSIQ) та ефективністю (параметри, MACs, час висновування) на тестових наборах DIV2K, RealSR і DRealSR. З-поміж ефективних моделей ті, що побудовані на попередньо навчених text-to-image опорних моделях, дають приріст до +0,13 CLIPIQA порівняно з моделями навченими з нуля. Використання LR-зображення, як початкової точки зворотного процесу, забезпечує кращий баланс перцепція-спотворення, порівняно зі початком з гаусового шуму. Моделі-студенти можуть показати кращі результати, ніж відповідні моделі-вчителі, за умови донавчання на еталонних зображеннях. Текстові запити слугують допоміжним, а не обов'язковим сигналом. InvSR та CCSR виносять баланс перцепція-спотворення як runtime-параметр на єдиній навченій моделі. Ущільнення у 4-6 разів майже не впливає на якість. Понад 10-кратне ущільнення погіршує перцептивну якість, хоча точність відтворення зберігається. VAE-декодер домінує в обчисленнях та затримці на пристрої, що робить його першочерговою ціллю ущільнення. Водночас ущільнені дифузійні SR-моделі, все ще, значно більші за GAN-моделі, і оптимальний компроміс між розміром моделі та якістю результату залишається недослідженим.uk_UA
dc.language.isouk_UAuk_UA
dc.publisherВНТУuk
dc.relation.ispartofНаукові праці Вінницького національного технічного університету. № 1.uk
dc.subjectimage super-resolutionuk
dc.subjectdiffusion modelsuk
dc.subjectоднокрокові дифузійнй моделіuk
dc.subjectущільнення дифузійних моделейuk
dc.subjectдистиляція знаньuk
dc.subjectStable Diffusionuk
dc.subjectглибоке навчанняuk
dc.titleЕфективні дифузійні моделі для SUPER-RESOLUTION зображеньuk
dc.title.alternativeEfficient diffusion models for super-resolution imagesen_US
dc.typeArticle, professional native edition
dc.identifier.udc004.8uk
dc.relation.referenceshttps://praci.vntu.edu.ua/index.php/praci/article/view/944uk
dc.identifier.doihttps://doi.org/10.31649/2307-5376-2026-1-89-99uk
dc.identifier.orcidhttps://orcid.org/0009-0000-5772-1085uk
dc.identifier.orcidhttps://orcid.org/0000-0003-0336-4910uk


Files in this item

Thumbnail

This item appears in the following Collection(s)

Show simple item record