Створення гібридної NLP-системи морфемного аналізу українськомовних слів

Loading...
Thumbnail Image
Date
2026
Authors
Кирилін, Єгор
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
Кваліфікаційну роботу присвячено розробленню гібридної NLP-системи морфемного аналізу українськомовних слів. Досліджено специфіку морфемної будови синтетичних флективних мов та проаналізовано обмеження наявних підходів: морфосинтаксичних аналізаторів, лексикографічних баз даних і великих мовних моделей у контексті завдання морфемної сегментації. Сформовано навчальний корпус з пар "словоформа–BIO-розмітка" на основі «Словника афіксальних морфем» та ВЕСУМ. Навчено та порівняно три архітектурні підходи: базовий класифікатор на основі випадкового лісу (44,70 % точності повного розбору слова), ансамбль спеціалізованих трансформерних моделей за частинами мови з маршрутизацією через UDPipe (69,96 %) та єдину універсальну трансформерну модель (81,04 %). На основі порівняльного аналізу спроєктовано пʼятирівневий гібридний каскадний конвеєр, що поєднує пошук за словником, нейромережеву класифікацію, перевірку структурної цілісності, верифікацію афіксів і комбінаторний генератор. Загальна точність гібридної системи на тестовій вибірці становить 94 %, що перевищує результати великих мовних моделей. Розроблено вебзастосунок із діагностичними візуалізаціями процесу аналізу.
Description
Keywords
обробка природної мови, українська мова, морфеміка, морфемна сегментація, трансформерна нейромережа, BIO-маркування, гібридна система, RoBERTa, класифікація токенів, компʼютерні науки, компʼютерні системи, навчання моделі, модель, нейронні мережі, великі мовні моделі, магістерська робота
Citation