Виявлення промо-елементів у відеорекламі соціальних мереж на основі OCR та LLM
Вантажиться...
Файли
Дата
Автори
Науковий керівник
Редактор
Інші учасники
Відповідальний
ORCID
Назва журналу
Номер ISSN
Назва тому
DOI
Альтернативна назва
Анотація
Рекламні відео в соціальних мережах часто містять промо-елементи у вигляді накладеного тексту (знижки, ціни, дедлайни акцій, умови пропозиції), які є критичними для аналітики кампаній та коректного маркування контенту. Автоматичне вилучення таких даних ускладнюється короткочасністю появи тексту, різноманіттям шрифтів і мов, а також артефактами стиснення відео. Запропоновано підхід до структурованого маркування промо-атрибутів на основі поєднання OCR для вилучення текстових фрагментів з кадрів [1] та великих мовних моделей (LLM) для семантичної інтерпретації й нормалізації значень у контрольовану схему з інструкційним форматом відповіді [3], [4]. Описано компоненти конвеєра обробки, модель даних промо-сутностей і механізми валідації, що підвищують відтворюваність результатів.
Social media video ads frequently include promotional overlays (discounts, prices, deadlines, and offer conditions) that are essential for campaign analytics and reliable content labeling. Automated extraction is challenged by short on-screen durations, multilingual typography, and compression artifacts. This paper proposes a structured labeling approach that combines OCR for frame-level text extraction [1] with LLM-based semantic interpretation and normalization into a controlled schema via instruction-following inference [3], [4]. The processing pipeline, promo-entity data model, and validation mechanisms are described to improve reproducibility.
Social media video ads frequently include promotional overlays (discounts, prices, deadlines, and offer conditions) that are essential for campaign analytics and reliable content labeling. Automated extraction is challenged by short on-screen durations, multilingual typography, and compression artifacts. This paper proposes a structured labeling approach that combines OCR for frame-level text extraction [1] with LLM-based semantic interpretation and normalization into a controlled schema via instruction-following inference [3], [4]. The processing pipeline, promo-entity data model, and validation mechanisms are described to improve reproducibility.
Опис
Ключові слова
УДК
Тип документа
Мова
ISSN
Посилання на публікацію
Серія, номер
ISBN
ББК
Інші ідентифікатори
Пов’язані матеріали
Спонсорська підтримка
Правовласник
Бібліографічний опис
Куліш С. П. Виявлення промо-елементів у відеорекламі соціальних мереж на основі OCR та LLM // Матеріали LV Всеукраїнської науково-технічної конференції підрозділів ВНТУ, Вінниця, 24-27 березня 2026 р. Електрон. текст. дані. 2026. Електрон. текст. дані. 2026. URI: https://conferences.vntu.edu.ua/index.php/all-fitki/all-fitki-2026/paper/view/27964.
Схвалення
Рецензія
Доповнено
Цитується в
Список використаної літератури (6)
- An Overview of the Tesseract OCR Engine [Електронний ресурс] - Режим доступу до ресурсу: https://research.google.com/pubs/archive/33418.pdf
- EAST: An Efficient and Accurate Scene Text Detector [Електронний ресурс] - Режим доступу до ресурсу: https://openaccess.thecvf.com/content_cvpr_2017/papers/Zhou_EAST_An_ Efficient_CVPR_2017_paper.pdf
- Language Models are Few-Shot Learners [Електронний ресурс] - Режим доступу до ресурсу: https://arxiv.org/abs/2005.14165
- Training language models to follow instructions with human feedback [Електронний ресурс] - Режим доступу до ресурсу: https://arxiv.org/abs/2203.02155
- GPT-5 System Card [Електронний ресурс] - Режим доступу до https://cdn.openai.com/gpt-5-system-card.pdf Introducing GPT-5 [Електронний ресурс] Режим доступу до https://openai.com/index/introducing-gpt-5/
- Visual Instruction Tuning [Електронний ресурс] - Режим доступу до https://arxiv.org/abs/2304.08485 ресурсу: ресурсу: ресурсу: