Розробка середовищ навчання з підкріпленням для пост-тренування великих мовних моделей
Loading...
Date
2026
Authors
Пушкарьов, Максим
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
Дипломна (магістерська) робота присвячена розробці PTL (Post-Training Language) — фреймворку для декларативного опису та виконання пайплайнів пост-тренування великих мовних моделей. Запропоновано предметноорієнтовану мову із PEG-граматикою, що описує багатоетапні пайплайни як спрямовані ациклічні графи з типізованими залежностями та вбудованою підтримкою функцій винагороди й верифікаторів. Розроблено пошарову систему середовищ навчання з підкріпленням, яка формалізує три рівні складності; у рамках прототипу реалізовано перший і другий рівні (вбудовані функції винагороди та модулі верифікації). Спроєктовано архітектуру оркестрації, незалежну від бекенду пост-тренування: контрактний інтерфейс TrainingBackend реалізовано двома адаптерами — TRL та Axolotl — із автоматизованим тестом перехресної семантичної парності згенерованих артефактів. Коректність і практичну придатність фреймворку підтверджено наскрізним пайплайном SFT → GRPO на моделі Llama-3.2-3B та корпусі GSM8K у межах фіксованого обчислювального бюджету. Доведено побайтну стабільність кодогенерації та семантичну еквівалентність артефактів між двома незалежно реалізованими бекендами.
Description
Keywords
великі мовні моделі, пост-тренування, навчання з підкріпленням, предметно-орієнтована мова, кодогенерація, бекенд-агностична оркестрація, навчальні середовища, верифіковані винагороди, магістерська робота