LoRA за полтора часа: как дообучить ASR для языка, который Whisper почти не знает
Оригинал: ASR для языка, которого Whisper почти не знает: LoRA за полтора часа — и почему полдела сделал декодер
Конспект редакции
Автор показывает, как за 90 минут адаптировать Whisper к крымскотатарскому через LoRA — и почему ключевую роль сыграл декодер.
Продолжение серии материалов о речевых технологиях для крымскотатарского языка: автор детально разбирает задачу распознавания речи (ASR) для языка, который Whisper почти не поддерживает. Эксперимент строится на едином отложенном тесте и единой методике скоринга — 893 клипа, около 1,86 часа аудио, два диктора.
Ключевой технический вывод — применение LoRA позволило дообучить модель примерно за полтора часа, то есть адаптация к низкоресурсному языку оказалась вполне доступной по вычислительным затратам. При этом, по наблюдению автора, значительную часть результата обеспечил декодер, а не только акустическая часть.
Материал будет полезен инженерам, работающим с ASR для миноритарных языков и оценивающим бюджет дообучения больших моделей. Полные таблицы результатов и детали методики — в статье на сайте источника.
Материал агрегирован; полный текст — на сайте Хабр — ИТ-новости.
Почему это важно
Для продакшенов, работающих с миноритарными языками и субтитрированием, это практический рецепт дешёвой адаптации ASR без переобучения модели с нуля.
Контекст
Это вторая статья серии о речевых технологиях для крымскотатарского языка; первая была посвящена общему обзору задачи.
Влияние на индустрию
Подход снижает порог входа для локализации и субтитрирования на редких языках — актуально для документалистики, фестивального кино и стриминговых каталогов.
Что дальше
Фото (4)
Увеличить1 / 4Упоминается
Комментарий редактора Игоря
Материал технический, но именно такие кейсы двигают индустрию субтитров и дубляжа вперёд — читать продакшн-инженерам обязательно.


