Ефективні дифузійні моделі для SUPER-RESOLUTION зображень
Вантажиться...
Файли
Дата
Назва журналу
Номер ISSN
Назва тому
Анотація
Дифузійні моделі встановили нові стандарти перцептивної якості у SISR, проте їхнє багатокрокове висновування та великий розмір моделі складнюють практичне розгортання: моделі на основі Stable Diffusion потребують 50–200 кроків знешумлення, секундні затримки та мільярди параметрів. Цей гляд систематизує два взаємодоповнюючі напрямки: ефективне проєктування дифузійного процесу, що скорочує ітеративне семплювання від сотень кроків до кількох, та ущільнення моделей для розгортання з обмеженими ресурсами. Проаналізовано дванадцять моделей 2023–2025 років: вісім ефективних(ResShift, SinSR, OSEDiff, TSD-SR, AddSR, DoSSR, CCSR, InvSR) та чотири ущільнених (AdcSR, PassionSR, Edge-SD-SR, BiMaCoSR), та проведено порівняння їх за якістю (SSIM, LPIPS, CLIPIQA, MUSIQ) та ефективністю (параметри, MACs, час висновування) на тестових наборах DIV2K, RealSR і DRealSR. З-поміж ефективних моделей ті, що побудовані на попередньо навчених text-to-image опорних моделях, дають приріст до +0,13 CLIPIQA порівняно з моделями навченими з нуля. Використання LR-зображення, як початкової точки зворотного процесу, забезпечує кращий баланс перцепція-спотворення, порівняно зі початком з гаусового шуму. Моделі-студенти можуть показати кращі результати, ніж відповідні моделі-вчителі, за умови донавчання на еталонних зображеннях. Текстові запити слугують допоміжним, а не обов'язковим сигналом. InvSR та CCSR виносять баланс перцепція-спотворення як runtime-параметр на єдиній навченій моделі. Ущільнення у 4-6 разів майже не впливає на якість. Понад 10-кратне ущільнення погіршує перцептивну якість, хоча точність відтворення зберігається. VAE-декодер домінує в обчисленнях та затримці на пристрої, що робить його першочерговою ціллю ущільнення. Водночас ущільнені дифузійні SR-моделі, все ще, значно більші за GAN-моделі, і оптимальний компроміс між розміром моделі та якістю результату залишається недослідженим.
Опис
УДК
Тип документа
Мова
ISSN
Бібліографічний опис
Козлов С. Л., Колесницький О. К. Ефективні дифузійні моделі для SUPER-RESOLUTION зображень // Наукові праці Вінницького національного технічного університету. Електрон. текст. дані (PDF: 524 КБ). 2026. № 1. URI: https://praci.vntu.edu.ua/index.php/praci/article/view/944.
Зібрання
Схвалення
Рецензія
Доповнено
Цитується в
Список використаної літератури (41)
- Blau Y., Michaeli T. The Perception-Distortion Tradeoff. 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Salt Lake City, UT, USA, 18–23 June 2018. 2018. URL: https://doi.org/10.1109/cvpr.2018.00652 (Last accessed: 22.02.2026).
- Real-Time Single Image and Video Super-Resolution Using an Efficient Sub-Pixel Convolutional Neural Network / W. Shi et al. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27–30 June 2016. 2016. URL: https://doi.org/10.1109/cvpr.2016.207 (Last accessed: 22.02.2026).
- Image Super-Resolution Using Very Deep Residual Channel Attention Networks / Y. Zhang et al. Computer Vision –ECCV 2018. Cham, 2018. P. 294–310. URL: https://doi.org/10.1007/978-3-030-01234-2_18 (Last accessed: 22.02.2026).
- SwinIR: Image Restoration Using Swin Transformer / J. Liang et al. 2021 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), Montreal, BC, Canada, 11–17 October 2021. 2021. URL: https://doi.org/10.1109/iccvw54120.2021.00210 (Last accessed: 22.02.2026).
- Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data / Wang X., Xie L., Dong C., Shan Y. 2021 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), Montreal, BC, Canada, 11–17 October 2021. 2021. URL: https://doi.org/10.1109/iccvw54120.2021.00217 (Last accessed: 22.02.2026).
- Image Super-Resolution via Iterative Refinement / C. Saharia et al. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023. Vol. 45, no. 4. P. 4713–4726. URL: https://doi.org/10.1109/tpami.2022.3204461 (Last accessed: 22.02.2026).
- High-Resolution Image Synthesis with Latent Diffusion Models / R. Rombach et al. 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), New Orleans, LA, USA, 18–24 June 2022. 2022. URL: https://doi.org/10.1109/cvpr52688.2022.01042 (Last accessed: 22.02.2026).
- Exploiting Diffusion Prior for Real-World Image Super-Resolution / J. Wang et al. International Journal of Computer Vision. 2024.Vol. 132, no. 12. P. 5929–5949. URL: https://doi.org/10.1007/s11263-024-02168-7 (Last accessed: 22.02.2026).
- SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution / R. Wu et al. 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2024. P. 25456–25467. URL: https://doi.org/10.1109/CVPR52733.2024.02405 (Last accessed: 22.02.2026).
- DiffBIR: Towards Blind Image Restoration with Generative Diffusion Prior / X. Lin et al. Computer Vision –ECCV 2024: 18th European Conference, Milan, Italy, September 29–October 4, 2024, Proceedings, Part LIX, Milan, Italy. 2024. P. 430–448. URL: https://dl.acm.org/doi/10.1007/978-3-031-73202-7_25 (Last accessed: 22.02.2026).