Один шаг из четырёх
Собственный контур обработки голоса состоит из четырёх шагов: запись, распознавание, сжатие в выжимку, сохранение. Работал он плохо: расшифровки получались точными, а выжимки — бессмысленными. Половина фактов терялась, оценки времени завышались, имена пропадали.
Первая мысль была: сборка кривая, надо брать готовый сервис.
Замер показал другое. Распознавание отрабатывало чисто — сырой текст совпадал с записью. Разваливался ровно третий шаг: сжатие делала слабая языковая модель, выбранная ради экономии на токенах. Три шага из четырёх были в порядке.
Лечится это не заменой системы, а сменой модели на одном шаге. Строка в настройках.
Ошибка тут типовая и дорогая. Система ощущается как единое целое, потому что пользуешься ей целиком — и результат тоже оценивается целиком. Плохой результат читается как «всё плохо», хотя ломается обычно одно звено.
Правило: прежде чем менять инструмент, найти шаг, на котором результат перестаёт быть верным. Для этого достаточно посмотреть, что выходит из каждого шага по отдельности — почти всегда становится видно, где обрыв.
Иначе выбрасывается работающее вместе с неработающим, а новый инструмент приносит ту же поломку, потому что причина была не в нём.
Есть вопрос по своему процессу?
Расскажите, что у вас считается руками каждую неделю. Посмотрим, где там теряются часы и стоит ли это вообще автоматизировать.
Написать в телеграм