ai-assistants

Как нейросеть переводит видео. Часть 1: Whisper врёт, и мы это знаем

Я один пишу сервис дубляжа видео с 2022 года, когда OpenAI выложил Whisper и мне показалось, что дело на месяц. В 2026-м через конвейер прошло 9 203 задачи, и он ломается в тех же местах, что и в первый. Первая часть из трёх: как звук становится текстом с таймкодами и спикерами. Три типа галлюцинаций Whisper и ловушки на каждый с кодом, почему мы выбрасываем его сегменты и собираем предложения сами, каскад на своей видеокарте с запасными выходами, хинди, который молча терял по 15 секунд речи, и честное ограничение: двое говорящих одновременно не бывает.

Читать далее →