Контент12 минобновлено

Whisper: транскрибация у себя на компьютере

Что такое Whisper и зачем ставить его у себя?

Коротко: Whisper - открытая модель OpenAI, которая превращает речь в текст. Её можно запустить на своём компьютере: бесплатно, без лимитов по минутам и без загрузки записей в чужие сервисы. Ставить руками не обязательно, это делает Claude Code.

Все уроки курса ClaudeBase я расшифровываю у себя на Mac: из этих текстов потом собираются конспекты и полные расшифровки на страницах уроков. Работает связка whisper.cpp и модели large-v3-turbo, скрипт для неё по моей просьбе написал Claude Code. Скрипт сам находит новые видео, вытаскивает звук и складывает рядом три файла: текст, субтитры и JSON. Готовый текст дальше можно отдавать языковой модели из своего кода, например через YandexGPT API, если нужен российский сервис.

Почему не онлайн-сервис: лимиты по минутам и загрузка записей в чужое облако. OpenAI выложила модель в открытый доступ, и её можно запустить у себя. Интернет нужен один раз, чтобы скачать программу и файл модели. Дальше компьютер работает сам: хоть сто часов записей, никаких счётчиков.

Почти все страницы в выдаче по этому запросу - сайты-обёртки, которые запускают тот же Whisper на своём сервере и берут деньги за минуты. Здесь другое: ставим Whisper к себе, и ставит его агент, а не ты. Я прогнал всё на Mac с процессором M1 26 сентября 2026 года: тексты ошибок и замеры скорости ниже взяты из моего терминала.

Если агента у тебя ещё нет, начни с него: установка Whisper - хорошая первая задача, на ней видно, как агент ставит программы и спрашивает разрешения. Этому посвящён первый модуль курса ClaudeBase: разница между агентом и чатом, работа с Claude Code через терминал и VS Code, выбор модели.

Какой у тебя компьютер и агент

Коротко: стартовых положений обычно четыре. От них зависит, какой вариант Whisper ставить и с какого раздела читать.

  • Mac с процессором M1, M2, M3 или новее. Тебе нужен whisper.cpp: он считает на графике Apple. Читай всё подряд.
  • Windows или Linux с видеокартой NVIDIA. Удобнее оригинальный openai-whisper для Python, он использует видеокарту через PyTorch.
  • Обычный ноутбук без видеокарты. Бери whisper.cpp и модель поменьше, small или сжатую turbo.
  • Агента ещё нет. Пройди установку Claude Code и приходи обратно.

Какой Whisper ставить: оригинал или whisper.cpp?

Коротко: есть два рабочих варианта. Оригинал от OpenAI проще в командах и читает любые файлы, но без видеокарты NVIDIA медленный. whisper.cpp быстрый на Mac и слабых машинах, но видео ему нужно сначала превратить в WAV.

openai-whisper whisper.cpp
Кто делает OpenAI сообщество, репозиторий ggml-org
На чём написан Python и PyTorch C и C++
Установка pip install -U openai-whisper brew install whisper.cpp (на Mac)
Программа whisper whisper-cli
Где считает видеокарта NVIDIA, иначе процессор графика Apple (Metal), процессор, другие ускорители
Какие файлы ест всё, что открывает ffmpeg, включая mp4 flac, mp3, ogg, wav
Модели скачивает сам при первом запуске файл ggml-*.bin скачиваешь отдельно

Оба варианта используют одни и те же модели от OpenAI, разница только в том, как их запускают. Оригиналу нужна программа ffmpeg в системе, это прямо сказано в README репозитория. Устройство по умолчанию он выбирает так: если есть видеокарта NVIDIA с CUDA, считает на ней, если нет - на процессоре. На Mac видеокарты NVIDIA не бывает, поэтому там оригинал работает на процессоре и заметно медленнее whisper.cpp.

Как поставить Whisper руками Claude Code?

Коротко: создаёшь пустую папку, запускаешь в ней агента и описываешь задачу словами. Агент сам подберёт команды под твою систему, покажет каждую перед запуском и проверит результат на коротком файле.

Команды установки отличаются от системы к системе, и на каждой машине находится своя мелочь: не тот Python, нет Homebrew, модель скачалась не туда. Разбираться с этим вручную долго. Агент делает то же самое быстрее и объясняет, что происходит.

Создай папку, например transkribaciya, открой её в терминале и запусти claude. Если терминал пока непривычен, загляни в статью про Claude Code в терминале. Дальше напиши агенту примерно так:

Хочу расшифровывать аудио и видео на русском у себя на компьютере через Whisper.
1. Посмотри, какая у меня система и есть ли видеокарта.
2. Выбери вариант: whisper.cpp для Mac и слабых машин, openai-whisper для NVIDIA.
3. Поставь ffmpeg и выбранный Whisper. Python-пакеты ставь только в виртуальное окружение.
4. Скачай модель large-v3-turbo в папку models внутри этой папки.
5. Сделай тестовый WAV с русской речью и расшифруй его, покажи текст.
Перед каждой командой объясняй, что она делает.

Агент будет спрашивать разрешение на каждую команду, это нормально. Читай, что именно он хочет запустить: установка через Homebrew или pip - обычное дело, удаление файлов вне папки проекта - повод остановить его и переспросить. Как устроены эти вопросы и когда можно разрешать без проверки, разобрано в статье про настройку Claude Code.

На моём Mac агент выполнил такую последовательность. Её полезно знать, чтобы понимать, что он делает:

brew install ffmpeg whisper.cpp
mkdir -p models
curl -L -o models/ggml-large-v3-turbo-q5_0.bin \
  https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo-q5_0.bin
whisper-cli -m models/ggml-large-v3-turbo-q5_0.bin -l ru -f test.wav

Для оригинального Whisper на Windows или Linux набор другой: pip install -U openai-whisper внутри виртуального окружения плюс ffmpeg из менеджера пакетов системы. Модель при первом запуске скачается сама в папку ~/.cache/whisper.

Какую модель выбрать для русского?

Коротко: для русского бери large-v3-turbo. Она почти так же точна, как самая большая large-v3, и в разы быстрее. Маленькие модели tiny и base годятся для проверки установки, но не для работы.

У Whisper шесть размеров модели. Таблица ниже собрана из README двух репозиториев: память для оригинала и вес файла для whisper.cpp.

Модель Память у оригинала Файл для whisper.cpp Для чего
tiny около 1 ГБ 75 МБ проверить, что всё запускается
base около 1 ГБ 142 МБ черновик, много ошибок в русском
small около 2 ГБ 466 МБ слабая машина, текст вычитывать
medium около 5 ГБ 1,5 ГБ перевод речи на английский
large-v3 около 10 ГБ 2,9 ГБ максимум точности, медленно
large-v3-turbo около 6 ГБ 1,5 ГБ, сжатая 547 МБ основная рабочая модель

Разницу я проверил на одном и том же файле: 13 секунд русской речи, сгенерированной встроенным голосом Mac. Фраза была такая: «…получаем текст с таймкодами». Модель base услышала «получаем текст стоим-кадами» и «Виспер» вместо Whisper. Сжатая large-v3-turbo выдала всё слово в слово, с правильной пунктуацией и разбивкой на предложения.

Ещё один приём, который я держу в своём скрипте: подсказка с терминами. Whisper не знает, как пишутся CLAUDE.md, MCP или VS Code, и пишет их на слух. У whisper-cli есть ключ prompt: в него кладут пару фраз в духе записи с нужными названиями, и модель берёт их как образец написания. По умолчанию подсказка действует на начало записи, для всей длины есть отдельный ключ carry-initial-prompt.

whisper-cli -m models/ggml-large-v3-turbo-q5_0.bin -l ru -f urok.wav -otxt --prompt "Урок про Claude Code, VS Code, MCP и файл CLAUDE.md."

Один нюанс из README оригинала: модель turbo не обучена переводу. Для перевода русской речи в английский текст бери medium или large.

Я сам плачу за подписки на нейросети картой для подписок «Плати по миру»: выпускается за пару минут, пополняется рублями через СБП. Оформить карту

Команда расшифровки и форматы файлов

Коротко: одна команда на файл. Главное - явно указать русский язык и нужные форматы. Для субтитров бери SRT или VTT, для чтения и конспектов - TXT, для программ - JSON.

Для whisper.cpp рабочая команда выглядит так:

whisper-cli -m models/ggml-large-v3-turbo-q5_0.bin -l ru -f zapis.wav -otxt -osrt -of zapis

Здесь -l ru - русский язык, -otxt и -osrt - сохранить текст и субтитры, -of zapis - имя файлов без расширения. Кроме этих двух whisper-cli умеет VTT, CSV, JSON и LRC, полный список показывает whisper-cli -h. Субтитры пригодятся и для роликов, которые Claude Code собирает кодом в Remotion: у Remotion есть отдельный скилл для субтитров.

Видео whisper-cli не открывает. Сначала вытаскиваем звук, команда взята из README whisper.cpp:

ffmpeg -i video.mp4 -ar 16000 -ac 1 -c:a pcm_s16le zapis.wav

У оригинального Whisper команда длиннее по флагам, зато видео можно отдавать сразу:

whisper video.mp4 --model turbo --language ru --output_format srt --output_dir subs

По умолчанию оригинал сохраняет все форматы сразу: txt, vtt, srt, tsv, json и jsonl. Если нужен один, укажи его в флаге формата, как в команде выше.

Вот как выглядит начало SRT-файла, который я получил:

1
00:00:00,000 --> 00:00:04,000
 Привет, это проверка расшифровки речи на своем компьютере.

SRT - самый ходовой формат субтитров, его загружают в видеоредакторы и на видеоплощадки. А TXT удобно сразу отдать агенту: «сделай из этой расшифровки конспект по разделам».

Сколько времени занимает расшифровка?

Коротко: на Mac M1 трёхминутная запись расшифровалась за 32 секунды моделью base и за 72 секунды моделью turbo. Это под сильной нагрузкой, на свободной машине быстрее.

Замер я делал честно, но в неидеальных условиях: параллельно на машине работали другие задачи, средняя загрузка процессора в момент замера держалась около 140. Поэтому цифры считай верхней границей.

Запись base large-v3-turbo q5_0
13 секунд 4,8 с 10,9 с
3 минуты 5 секунд 32 с 72 с

Выходит, turbo на M1 работает примерно в 2,5 раза быстрее реального времени: час записи займёт около 25 минут. Запускаешь, идёшь заниматься своими делами, возвращаешься к готовому тексту. Base быстрее, но экономия в пару минут не стоит ошибок, которые потом вычищать руками.

На машине с видеокартой NVIDIA оригинальный Whisper работает быстрее, но у меня такой машины нет, и цифры я не приводил.

Польза появляется после расшифровки. Сырой текст мало кому нужен: из него делают конспект, выжимку для поста, субтитры, базу вопросов клиентов. Пересказывать агенту порядок каждый раз надоедает, поэтому порядок действий упаковывают в скилл, а обработку пачки файлов - в сценарий с субагентами. В курсе ClaudeBase урок «Хуки, скиллы, субагенты и сценарии» разобран ровно на этой задаче: конспекты из расшифровок видео, где агент сам находит файлы без конспекта и обрабатывает их параллельно.

Частые ошибки при расшифровке

Коротко: пять ошибок, на которые натыкаешься в первые полчаса. У каждой понятная причина и короткое лечение.

error: failed to read audio file ‘video.mp4’

whisper-cli не читает видео и форматы кроме flac, mp3, ogg и wav. Переведи звук в WAV 16 кГц командой ffmpeg из раздела выше или попроси агента сделать это.

failed to open ‘models/ggml-base.en.bin’

Программа запустилась без указания модели и ищет файл по умолчанию, английскую base. Укажи свою модель через -m и полный путь к файлу .bin. Если путь относительный, запускай команду из той папки, где лежит models.

Текст пришёл на английском: «Hello, this is the check of…»

Ошибки в терминале нет, но вместо расшифровки получился кривой перевод на английский. У whisper-cli язык по умолчанию английский. Добавь -l ru. Для автоопределения языка есть -l auto, но для русской речи надёжнее указать язык явно.

error: externally-managed-environment

Так отвечает pip, если ставить openai-whisper в системный Python, установленный через Homebrew. Система защищает свой Python от чужих пакетов. Решение - виртуальное окружение: попроси агента создать его в папке проекта и ставить пакеты туда.

zsh: command not found: whisper

Пакет стоит в виртуальном окружении, а окружение не активировано, либо установка не прошла. Попроси агента проверить, где лежит программа, и дать команду запуска с полным путём. Для whisper.cpp программа называется whisper-cli, а не whisper.

Чек-лист рабочей расшифровки

  • Выбран вариант: whisper.cpp для Mac и слабых машин, openai-whisper для NVIDIA.
  • ffmpeg установлен и отвечает на ffmpeg -version.
  • Модель large-v3-turbo скачана, путь к ней известен.
  • Тестовый файл на 10-20 секунд расшифрован на русском, без перевода на английский.
  • Для видео звук сначала вытаскивается в WAV 16 кГц.
  • На выходе есть TXT для чтения и SRT с таймкодами.
  • Порядок действий записан в скилл или правила проекта.

Что делать с расшифровками дальше?

Коротко: закрепи расшифровку как постоянный инструмент агента и настрой, что он делает с текстом дальше.

  1. Сделай из этого скилл. Как устроены скиллы и где их хранить, разобрано в статье про скиллы Claude Code. Одна фраза «расшифруй и сделай конспект» будет запускать всю цепочку.
  2. Запиши правила. Модель, язык и папку для результатов удобно держать в CLAUDE.md, чтобы агент не переспрашивал.
  3. Посмотри на другие локальные задачи. Whisper - пример того, как агент ставит и гоняет программы у тебя на машине. Больше таких сценариев в статье про локального ИИ-агента.

Если хочешь, чтобы агент сразу работал по готовым настройкам, загляни в ClaudeBase: там уроки курса с конспектами и расшифровками и рабочая база для подключения по MCP. Через неё агент сам достаёт скиллы, разрешения и правила проекта.

Спрашивают

Пять вопросов по теме

Whisper бесплатный?

Да. Код и веса моделей OpenAI выложила открыто, whisper.cpp тоже распространяется бесплатно под лицензией MIT. Платить не нужно ни за установку, ни за минуты записи: всё считает твой компьютер. Платный вариант есть только у облачного API OpenAI, но для локальной расшифровки он не нужен.

Какую модель Whisper взять для русского языка?

Для русского бери large-v3-turbo: это ускоренная версия large-v3 с почти той же точностью. В моём прогоне она расшифровала тестовую запись без ошибок, а base на том же файле сделала из «с таймкодами» бессмыслицу. На слабой машине подойдёт small, но вычитывать текст придётся внимательнее.

Сколько времени занимает расшифровка часа записи?

Зависит от машины и модели. На Mac M1 трёхминутная запись через large-v3-turbo заняла 72 секунды, причём компьютер в это время был сильно загружен другими задачами. Грубо это час записи примерно за 25 минут. Модель base примерно вдвое быстрее, но ошибается чаще.

Можно ли расшифровать видео, а не только аудио?

Можно. Оригинальный openai-whisper сам открывает mp4 и другие форматы через ffmpeg. Программа whisper-cli из whisper.cpp видео не читает и отвечает ошибкой failed to read audio file, поэтому сначала звук вытаскивают в WAV 16 кГц одной командой ffmpeg. Claude Code делает этот шаг сам, если его попросить.

Нужен ли интернет для работы Whisper?

Только один раз, чтобы скачать программу и файл модели. Сжатая модель large-v3-turbo весит около 550 МБ, полная около 1,5 ГБ. Дальше расшифровка идёт целиком на твоём компьютере: записи никуда не уходят, лимитов по минутам нет, работать можно даже без сети.

Источники