• українська
    • English
  • English 
    • українська
    • English
  • Login
View Item 
  • Frontpage
  • Науково-технічна бібліотека
  • Публікації співробітників бібліотеки
  • JetIQ
  • View Item
  • Frontpage
  • Науково-технічна бібліотека
  • Публікації співробітників бібліотеки
  • JetIQ
  • View Item
Сайт інституційного репозитарію ВНТУ містить роботи, матеріали та файли, які були розміщені докторантами, аспірантами та студентами Вінницького Національного Технічного Університету. Для розширення функцій сайту рекомендується увімкнути JavaScript.

Prompt-guided LLM agent for end-to-end ontology learning

Author
Teplyi, Ya.
Dosyn, D.
Теплий, Я.
Досин, Д.
Date
2025
Metadata
Show full item record
Collections
  • JetIQ [28]
Abstract
Перетворення знань великих мовних моделей (LLM) на логічні, машинно-інтерпретовані онтології є складним завданням. Звичайні стратегії з простими запитами часто породжують неоднозначні або взаємно несумісні триплети, які не можна безпечно об’єднати з інснуючими базами знань. У цій роботі розроблено й емпірично перевірено повністю автоматизований робочий процес, що перетворює текст на RDF/OWL-твердження, узгоджені зі схемою, без участі людини. Створений агент об’єднує чотири етапи – виявлення схеми, виявлення екземплярів, самовалідацію з виправленнями та узгодження онтології – кожен реалізовано як структурований запит до LLM. Валідатор перевіряє кожне твердження на дотримання обмежень; будь-яке порушення запускає ітеративний цикл аналіз помилок / виправлення схеми / виправлення екземплярів до досягнення узгодженості. Робочий процес було протестовано з трьома родинами LLM – GPT-4.1-mini, LLaMA-3.3-70b та Grok-3-mini, які представляють висококласні пропрієтарні, відкриті та бюджетні компактні моделі. Якість оцінювалася на синтетичному бенчмарку MINE та на двох реальних наборах текстів: десяти англомовних виданнях CEUR-WS і десяти українських випусках журналу «Вісник Національного університету “Львівська політехніка” “Інформаційні системи та мережі”». На MINE агент із використанням LLaMA-3.3-70b досяг 67,5 % точності, перевершивши KGGen (66,07 %) і водночас забезпечивши узгодженість схеми; GPT-4.1-mini та Grok-3-mini набрали 59,8 % і 52,4 % відповідно. Під час обробки текстів двома мовами усі моделі відтворили відношення автор – публікація – журнал, запропонували до 39 нових класів і 29 нових відношень, а також створили понад 800 індивідів у кожному наборі з лише незначними неузгодженостями. Вилучена схема залишалися англійською навіть для українських ввідних даних. Хоча GPT-4.1-mini та LLaMA-3.3-70b генерували ширші та коректні схеми, проте більшість концептів залишилися без індивідів, а Grok-3-mini запропонувала компактну та повністю заповнену схему з індивідами. Практичним результатом є робочий процес, який можна застосовувати до цифрових бібліотек або галузевих порталів, для автоматизованого розширення наявні графи знань із мінімальними людськими витратами, що знижує вартість для підтримки та збагачення існуючих онтологій.
 
Turning the vast knowledge of large language models (LLMs) into logical, machine-interpretable ontologies poses a difficult task. Conventional single-prompt strategies often generated ambiguous or mutually inconsistent triples could not be merged safely with reference knowledge bases. The present work therefore aimed to design and empirically verify an entirely automated workflow that converts raw text into schema–compliant RDF/OWL statements without manual intervention. The resulting agent combined four stages – schema discovery, instance extraction, self-repair validation, and ontology alignment – each expressed as structured prompts executed by an LLM. A validator inspected every candidate assertion against the extracted domain-range constraints; any violation triggered an iterative analyseerrors / fix-schema / fix-instances loop until consistency was reached. The workflow was instantiated with three families of LLMs – GPT-4.1-mini, LLaMA-3.3-70b, and Grok-3-mini – chosen to represent high-end proprietary, open-weights, and cost-efficient small models. Quality was measured on the synthetic Measure of Information in Nodes and Edges (MINE) benchmark and on two real scholarly texts: ten English CEUR-WS workshop volumes and ten Ukrainian issues of the Journal of Lviv Polytechnic National University “Information Systems and Networks”. On MINE the agent paired with LLaMA-3.3-70b achieved 67.5% fact recall, surpassing the KGGen pipeline (66.07%) while still enforcing schema coherence; GPT-4.1-mini and Grok-3-mini reached 59.8% and 52.4%, respectively. When applied to the bilingual texts, all models reproduced the canonical author–paper–journal relation, proposed up to 39 new classes and 29 new relations, and instantiated more than 800 individuals per dataset with only minor post-repair inconsistencies. Extracted labels remained in English even for Ukrainian inputs. While GPT-4.1-mini and LLaMA-3.3-70b generated broader and valid schema yet most of the schema remained uninitiated, when Grok-3-mini produced concise and fully populated schema with instances. The practical outcome is a pipeline that can be used on digital libraries or domain portals to expand existing knowledge graphs continuously and with minimal human effort, thereby lowering the cost for ontology maintenance and enrichment.
 
URI:
https://ir.lib.vntu.edu.ua/handle/123456789/52438
View/Open
206703.pdf (3.812Mb)

Institutional Repository

FrontpageSearchHelpContact UsAbout Us

University Resources

JetIQLibrary websiteUniversity websiteE-catalog of VNTU

Browse

All of DSpaceCommunities & CollectionsBy Issue DateAuthorsTitlesSubjectsTypePublisherLanguageUdcISSNPublicationDOIThis CollectionBy Issue DateAuthorsTitlesSubjectsTypePublisherLanguageUdcISSNPublicationDOI

My Account

Login

ISSN 2413-6360 | Frontpage | Send Feedback | Help | Contact Us | About Us
© 2016 Vinnytsia National Technical University | Extra plugins code by VNTU Linuxoids | Powered by DSpace
Працює за підтримки 
НТБ ВНТУ