Чтобы расшифровать аудио нейросетью, подготовьте читаемый звуковой файл, выберите распознавание речи на исходном языке и сохраните текст с временными метками. Затем прослушайте запись вместе с черновиком: исправьте имена, числа, отрицания и пропуски. Только после этой сверки превращайте расшифровку в заметку, интервью или протокол.
Ниже — рабочий порядок действий, команды для локального Whisper на Windows и промпт для последующей редактуры. Документы и публичные страницы Искры проверены 7 октября 2026 года. Команды сверены с документацией, но установку и распознавание записи редакция для этой статьи не запускала. Пример ошибок составлен вручную; измерений точности и скорости здесь нет.
1. Определите, какой текст нужен
| Задача | Что сохранить | Как проверить |
|---|---|---|
| Дословная расшифровка | Сказанные слова, оговорки и неразборчивые места | Сравнить с записью, не заменять речь пересказом |
| Читаемое интервью | Смысл реплик, порядок диалога и существенные уточнения | Сверить редакторские сокращения с дословной версией |
| Конспект или протокол | Темы, подтверждённые решения и открытые вопросы | Для каждого вывода найти реплику-основание |
Транскрибация переносит речь в текст. Перевод меняет язык, а краткое содержание отбирает часть сказанного. Если сразу попросить «сделай красиво и выдели главное», можно получить удобный пересказ без важных условий. Сначала получите и сохраните расшифровку, затем редактируйте отдельную копию.
Заранее решите, нужны ли таймкоды и подписи говорящих. Для цитирования удобна привязка к записи, для субтитров — файл SRT или VTT. Имена участников не следует угадывать по голосу: сначала используйте нейтральные метки, а соответствие имени подтверждайте по самой встрече или у участников.
2. Подготовьте запись и короткий образец
Перед распознаванием
- Сохраните исходник отдельно. Работайте с копией, чтобы после обработки можно было вернуться к оригинальному звуку.
- Прослушайте начало, середину и конец: есть ли речь, одинаково ли слышны участники, не оборвана ли запись.
- Возьмите небольшой характерный фрагмент для первой попытки: с обычной речью, сложным термином и числом. Это проба настройки, а не доказательство качества всей записи.
- Запишите небольшой словарь: фамилии, названия продуктов и сокращения, которые действительно встречаются в разговоре.
- Для облачной обработки проверьте, допускается ли передача этой записи выбранному сервису. Удалите из рабочей копии ненужные конфиденциальные фрагменты по правилам вашей организации.
Не меняйте расширение файла вместо преобразования формата. Название recording.mp3 не делает запись MP3, если внутри другой контейнер. Сначала убедитесь, что файл нормально воспроизводится. Если есть только голосовое сообщение, сохраните исходный аудиофайл, а не запись экрана с дополнительными звуками.
При делении длинного разговора отмечайте начало каждого фрагмента относительно оригинала. Например, у части, начатой с 12:00, локальная отметка 00:25 соответствует 12:25 исходной записи. Не вырезайте паузы из единственной копии: тогда временные метки перестанут совпадать с оригиналом.
3. Расшифруйте файл локальным Whisper
Этот вариант требует установки программ и использует ресурсы вашего компьютера. Нужны Python 3.11 с доступной командой py и FFmpeg в PATH; инструкции установки FFmpeg для Windows перечислены в README Whisper. Выполняйте команды в PowerShell внутри отдельной папки с записью. Первый запуск скачивает веса модели, поэтому подготовка требует интернета.[1][5]
Создайте отдельное окружение Python и установите пакет. Путь к его интерпретатору указан явно, поэтому активировать окружение отдельной командой не нужно. Если py -3.11 не найден, сначала установите Python 3.11 и проверьте доступность этой версии.[5]
Команды PowerShell — выполняйте по одной строке
- py -3.11 -m venv .venv
- .\.venv\Scripts\python.exe -m pip install -U openai-whisper
- ffmpeg -version
Команда ffmpeg -version должна вывести сведения о программе. Если PowerShell сообщает, что команда не найдена, завершите установку FFmpeg и настройку PATH, затем откройте новое окно терминала. Переходить к распознаванию до этого бессмысленно: Whisper использует FFmpeg для чтения аудио.[1]
Для короткой русской записи recording.mp3 выполните команду ниже. base — стартовый пример многоязычной модели, а не рекомендация по максимальной точности. Варианты с суффиксом .en предназначены для английского. Обработка на CPU может занять значительное время; срок зависит от компьютера и записи.[1]
.\.venv\Scripts\python.exe -m whisper "recording.mp3" --model base --language Russian --task transcribe --device cpu --fp16 False --output_format all --output_dir transcript
Здесь transcribe сохраняет язык речи; translate в Whisper означает перевод на английский. Параметр all сохраняет доступные форматы вывода, в том числе TXT, SRT и VTT, в папку transcript. Откройте TXT для вычитки, а SRT или VTT — для проверки временных меток. Это параметры локальной программы: они не описывают набор настроек в интерфейсе Искры.[2]
Сначала проверьте короткий образец и только затем повторите команду с полным файлом. Если установленная версия не принимает параметр, посмотрите её справку: .\.venv\Scripts\python.exe -m whisper --help. Не подменяйте незнакомую настройку догадкой. Не обещайте себе автоматическое разделение по именам: приведённая команда такого результата не гарантирует.
Что доступно в Искре сейчас
В публичном инструменте «Расшифровка аудио» есть выбор GPT-4o Transcribe и Whisper-1, поле задачи и переход в студию. Однако 7 октября 2026 года оба варианта показаны без подтверждённой цены, а страница сообщает о недоступности платного запуска. Наличие карточки модели само по себе не означает, что запись уже можно обработать.
В карточке Whisper-1 отдельно указаны операции расшифровки и перевода. Контракт CometAPI для транскрибации предусматривает аудиофайл, модель, язык и формат ответа. Это описание API, а не подтверждение всех возможностей пользовательской формы. Когда тариф появится, сначала проверьте выбранную операцию, допустимый файл и итоговую стоимость в студии; не переносите сюда лимиты другого сервиса.[4]
4. Сверьте расшифровку с аудио
Читайте черновик одновременно с прослушиванием. Начните с мест, где ошибка меняет действие: «не отправлять», «до пятницы», «пятнадцать», фамилия ответственного. Затем проверьте пропущенные реплики и повторяющиеся фразы. В карточке Whisper разработчик прямо описывает риск появления текста, которого не было в звуке, и повторов. Гладкий текст ещё не доказывает правильное распознавание.[3]
| Условно сказано в записи | Возможная ошибка черновика | Что исправить после прослушивания |
|---|---|---|
| «Не отправляйте счёт до согласования» | «Отправляйте счёт до согласования» | Вернуть «не»: без него действие противоположное |
| «Пятнадцать, не пятьдесят тысяч» | «Пятьдесят тысяч» | Сохранить исправление говорящего и верное число |
| «Макет посмотрим во вторник, срок пока не утверждён» | «Сдать макет во вторник» | Не превращать обсуждение в утверждённый срок |
| Неразборчивое название в 02:18 | Правдоподобное название компании | Отметить [неразборчиво, 02:18] и уточнить |
Если слово не удаётся разобрать, оставьте отметку и таймкод. Словарь помогает сверять написание, но не даёт права вставлять подходящее название вместо неуслышанного. При одновременной речи отметьте наложение голосов; не собирайте из обрывков уверенную цитату. Для важных цитат полезно повторно прослушать фразу целиком с соседними предложениями.
Порядок ручной сверки
- Смысл: отрицания, условия, обещания, вопросы и предположения.
- Факты: имена, суммы, даты, единицы измерения и названия.
- Полнота: начало и конец записи, переходы между частями, пропуски и повторы.
- Атрибуция: кому принадлежит реплика и чем подтверждена подпись.
- Время: совпадают ли отметки с исходным файлом, особенно после нарезки.
5. Отредактируйте проверенный текст отдельным проходом
В текстовую модель передавайте уже сверенный фрагмент. Она может помочь с абзацами, пунктуацией и форматом, но без аудио не проверит, что было произнесено. Держите дословную и отредактированную версии рядом. Для длинного интервью обрабатывайте законченные части с постоянными обозначениями говорящих.
Отредактируй проверенную расшифровку ниже для чтения. Это текстовый этап, аудиозаписи у тебя нет. Правила: 1. Исправь пунктуацию и раздели реплики на абзацы. 2. Сохрани отрицания, числа, имена, условия, сомнения и порядок реплик. Не превращай предложение в принятое решение. 3. Не заполняй метки [неразборчиво] и не придумывай имена говорящих. Сохрани таймкоды без изменений. 4. Не сокращай факты. Удаление слов-паразитов и повторов предложи отдельно, чтобы я мог сверить их с исходником. 5. Верни отредактированный текст, список существенных правок и вопросы к неясным местам. Не добавляй ответы на эти вопросы. Расшифровка: [вставьте сверенный фрагмент]
Этот промпт можно вставить в инструмент Искры «Чат и тексты», выбрать доступную текстовую модель и продолжить в студии. Перед отправкой проверьте стоимость и состав текста. Поле prompt в API распознавания речи имеет другую роль: оно служит подсказкой для распознавания или продолжения сегмента; не следует считать его универсальным чат-заданием на редактуру.[4]
После редактуры снова проверьте места, где менялись формулировки. Если нужен протокол, попросите отдельную таблицу «решение — ответственный — срок — реплика-основание». Пустое поле лучше предположения: отсутствие названного срока не означает, что его можно вычислить из контекста.
Частые проблемы при расшифровке
| Проблема | Что проверить | Следующий шаг |
|---|---|---|
| Текст появился на тишине | Есть ли речь в этом месте оригинала | Убрать выдуманный фрагмент после прослушивания, проверить соседние паузы |
| Повторяется одно предложение | Не повторяется ли сам звук | Сверить участок и повторно обработать небольшой фрагмент |
| Получился английский текст | Не выбрана ли задача translate | Для исходного языка использовать transcribe |
| Перепутаны участники | Есть ли вообще разметка говорящих | Подписать вручную по подтверждённым репликам |
| Субтитры отстают от записи | Не изменена ли длительность исходника | Проверить начало, середину и конец, исправить привязку |
Как понять, что результат готов
Перед использованием текста
- Исходник сохранён, и понятно, к какой версии записи относится расшифровка.
- Важные реплики прослушаны, имена и числа сверены, сомнительные места помечены.
- Текст не содержит вымышленных фраз на паузах и необъяснимых повторов.
- Цитаты отличаются от пересказа, а решения — от предложений и обсуждений.
- Таймкоды проверены; SRT или VTT просмотрены вместе с видео, если нужны субтитры.
- Получателю понятно, где остались вопросы и какие фрагменты требуют уточнения.
Для повторяющихся встреч сохраните этот порядок как шаблон: исходный файл, параметры распознавания, дословный текст, список исправлений и итоговая редакция. Так следующая запись начнётся с понятного процесса, а спорное место можно будет быстро найти в оригинале.
