Автоматичне транскрибування та ідентифікація у змішаному українсько-англійському мовленні

Loading...
Thumbnail Image
Date
2026
Authors
Нікітін, Руслан
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
Магістерська робота присвячена оцінюванню та порівнянню сучасних архітектур автоматичного розпізнавання мовлення на задачі транскрибування змішаного українсько-англійського мовлення. Досліджено особливості роботи локальних Encoder-Decoder моделей, комерційних API-сервісів та мультимодальних великих мовних моделей, а також методи ізольованого оцінювання помилок (метрика CS-WER) і зворотної текстової нормалізації. Розроблено спеціалізований еталонний корпус uk-en-code-mixed-asr-2h з параметрами: 448 аудіозаписів загальною тривалістю понад 2 години, ІТ-домен, 99,6 % внутрішньореченнєвого перемикання кодів. Реалізовано настільний застосунок для транскрибування повного циклу, який об'єднує підсистеми детектування активності мовлення із двопороговим гістерезисом, розпізнавання тексту та діаризації з міжсесійною ідентифікацією мовців на основі векторів ECAPA-TDNN. Експериментальне порівняння 49 конфігурацій моделей показало такі результати (загальний WER після ITN-нормалізації): найкраща мультимодальна Audio-LLM Gemini 3.1 Pro – 0,105, найкращий комерційний API ElevenLabs Scribe v2 – 0,134, найкраща локальна модель Whisper large-v3-turbo – 0,167. Встановлено, що показник помилок на англійських термінах системно перевищує помилки на українських словах у 3-10 разів. Застосування алгоритму ITN знизило кількість помилок на англіцизмах у середньому на 13 %, що доводить орфографічну, а не акустичну природу збоїв (кирилична транслітерація термінів). Дослідження моделей наскрізного перекладу виявило неспроможність традиційних архітектур коректно обробляти ІТ-сленг через дослівне калькування. Натомість мультимодальні Audio-LLM продемонстрували високу ефективність у семантичній адаптації українського професійного жаргону в технічну англійську мову, що робить переклад життєздатною альтернативою транскрибуванню з ITN.
Description
Keywords
автоматичне розпізнавання мовлення, ASR, code-switching, змішане українсько-англійське мовлення, CS-WER, зворотна текстова нормалізація (ITN), діаризація, ідентифікація мовця, магістерська робота
Citation