Автоматизоване формування простору ознак із неструктурованих медичних записів для задач виявлення статистичних аномалій
Abstract
Роботу присвячено вирішенню задачі автоматизованої структуризації текстових медичних даних для подальшого статистичного аналізу та виявлення аномалій. Проведено дослідження методів витягування іменованих сутностей (симптомів) з неструктурованих скарг пацієнтів українською мовою. Для експериментального аналізу сформовано синтетичний корпус текстів на основі класифікатора ІСPC-2, що забезпечує семантичну валідність даних. Виконано порівняльний аналіз трьох підходів: на основі правил (rulebased), з використанням великої мовної моделі (LLM) та гібридного методу. Встановлено, що гібридний підхід забезпечує найкращий баланс між повнотою (Recall) та інтерпретованістю результатів, що є критично важливим для формування достовірної вибірки при пошуку аномалій у медичній статистиці. The paper addresses the problem of automated structuring of text-based medical data for further statistical analysis and anomaly detection. Methods for Named Entity Recognition (symptom extraction) from unstructured patient complaints in Ukrainian were investigated. A synthetic text corpus based on the ICPC-2 classifier was generated for experimental analysis. A comparative analysis of three approaches was performed: rule-based, Large Language Model (LLM), and a hybrid method. It was determined that the hybrid approach provides the best balance between Recall and interpretability, which is critical for forming a reliable dataset for anomaly detection in medical statistics.
URI:
https://ir.lib.vntu.edu.ua/handle/123456789/54544

