Асиметрична архітектура сегментації зображень на базі візуально-мовних моделей (QWEN3-VL) та SAM 3 asymmetrical architecture of segmentation images based on visual models (QWEN3-VL) and SAM 3
Автор
Кривошей, І. М.
Софина, О. Ю.
Kryvoshei, I. M.
Sofina, O.
Дата
2026Metadata
Показати повну інформаціюАнотації
У роботі розглядається реалізація автоматизованої системи семантичної сегментації зображень з використанням відкритого словника понять. Запропоновано асиметричну архітектуру, що поєднує візуально-мовну модель Qwen3-VL для ідентифікації об'єктів та Segment Anything Model 3 (SAM 3) для їх точної полігональної сегментації. Розроблено інтерактивний веб-додаток на базі Streamlit для просторової аналітики та телеметрії в реальному часі. This paper discusses the implementation of an automated semantic image segmentation system using an open vocabulary of concepts. An asymmetric architecture is proposed, combining the Qwen3-VL vision-language model for object identification and Segment Anything Model 3 (SAM 3) for their precise polygonal segmentation.
URI:
https://ir.lib.vntu.edu.ua/handle/123456789/54562

