Что такое Whisper и зачем ставить его у себя?
Коротко: Whisper - открытая модель OpenAI, которая превращает речь в текст. Её можно запустить на своём компьютере: бесплатно, без лимитов по минутам и без загрузки записей в чужие сервисы. Ставить руками не обязательно, это делает Claude Code.
Все уроки курса ClaudeBase я расшифровываю у себя на Mac: из этих текстов потом собираются конспекты и полные расшифровки на страницах уроков. Работает связка whisper.cpp и модели large-v3-turbo, скрипт для неё по моей просьбе написал Claude Code. Скрипт сам находит новые видео, вытаскивает звук и складывает рядом три файла: текст, субтитры и JSON. Готовый текст дальше можно отдавать языковой модели из своего кода, например через YandexGPT API, если нужен российский сервис.
Почему не онлайн-сервис: лимиты по минутам и загрузка записей в чужое облако. OpenAI выложила модель в открытый доступ, и её можно запустить у себя. Интернет нужен один раз, чтобы скачать программу и файл модели. Дальше компьютер работает сам: хоть сто часов записей, никаких счётчиков.
Почти все страницы в выдаче по этому запросу - сайты-обёртки, которые запускают тот же Whisper на своём сервере и берут деньги за минуты. Здесь другое: ставим Whisper к себе, и ставит его агент, а не ты. Я прогнал всё на Mac с процессором M1 26 сентября 2026 года: тексты ошибок и замеры скорости ниже взяты из моего терминала.
Если агента у тебя ещё нет, начни с него: установка Whisper - хорошая первая задача, на ней видно, как агент ставит программы и спрашивает разрешения. Этому посвящён первый модуль курса ClaudeBase: разница между агентом и чатом, работа с Claude Code через терминал и VS Code, выбор модели.
Какой у тебя компьютер и агент
Коротко: стартовых положений обычно четыре. От них зависит, какой вариант Whisper ставить и с какого раздела читать.
- Mac с процессором M1, M2, M3 или новее. Тебе нужен whisper.cpp: он считает на графике Apple. Читай всё подряд.
- Windows или Linux с видеокартой NVIDIA. Удобнее оригинальный openai-whisper для Python, он использует видеокарту через PyTorch.
- Обычный ноутбук без видеокарты. Бери whisper.cpp и модель поменьше, small или сжатую turbo.
- Агента ещё нет. Пройди установку Claude Code и приходи обратно.
Какой Whisper ставить: оригинал или whisper.cpp?
Коротко: есть два рабочих варианта. Оригинал от OpenAI проще в командах и читает любые файлы, но без видеокарты NVIDIA медленный. whisper.cpp быстрый на Mac и слабых машинах, но видео ему нужно сначала превратить в WAV.
| openai-whisper | whisper.cpp | |
|---|---|---|
| Кто делает | OpenAI | сообщество, репозиторий ggml-org |
| На чём написан | Python и PyTorch | C и C++ |
| Установка | pip install -U openai-whisper | brew install whisper.cpp (на Mac) |
| Программа | whisper | whisper-cli |
| Где считает | видеокарта NVIDIA, иначе процессор | графика Apple (Metal), процессор, другие ускорители |
| Какие файлы ест | всё, что открывает ffmpeg, включая mp4 | flac, mp3, ogg, wav |
| Модели | скачивает сам при первом запуске | файл ggml-*.bin скачиваешь отдельно |
Оба варианта используют одни и те же модели от OpenAI, разница только в том, как их запускают. Оригиналу нужна программа ffmpeg в системе, это прямо сказано в README репозитория. Устройство по умолчанию он выбирает так: если есть видеокарта NVIDIA с CUDA, считает на ней, если нет - на процессоре. На Mac видеокарты NVIDIA не бывает, поэтому там оригинал работает на процессоре и заметно медленнее whisper.cpp.
Как поставить Whisper руками Claude Code?
Коротко: создаёшь пустую папку, запускаешь в ней агента и описываешь задачу словами. Агент сам подберёт команды под твою систему, покажет каждую перед запуском и проверит результат на коротком файле.
Команды установки отличаются от системы к системе, и на каждой машине находится своя мелочь: не тот Python, нет Homebrew, модель скачалась не туда. Разбираться с этим вручную долго. Агент делает то же самое быстрее и объясняет, что происходит.
Создай папку, например transkribaciya, открой её в терминале и запусти claude. Если терминал пока непривычен, загляни в статью про Claude Code в терминале. Дальше напиши агенту примерно так:
Хочу расшифровывать аудио и видео на русском у себя на компьютере через Whisper.
1. Посмотри, какая у меня система и есть ли видеокарта.
2. Выбери вариант: whisper.cpp для Mac и слабых машин, openai-whisper для NVIDIA.
3. Поставь ffmpeg и выбранный Whisper. Python-пакеты ставь только в виртуальное окружение.
4. Скачай модель large-v3-turbo в папку models внутри этой папки.
5. Сделай тестовый WAV с русской речью и расшифруй его, покажи текст.
Перед каждой командой объясняй, что она делает.
Агент будет спрашивать разрешение на каждую команду, это нормально. Читай, что именно он хочет запустить: установка через Homebrew или pip - обычное дело, удаление файлов вне папки проекта - повод остановить его и переспросить. Как устроены эти вопросы и когда можно разрешать без проверки, разобрано в статье про настройку Claude Code.
На моём Mac агент выполнил такую последовательность. Её полезно знать, чтобы понимать, что он делает:
brew install ffmpeg whisper.cpp
mkdir -p models
curl -L -o models/ggml-large-v3-turbo-q5_0.bin \
https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo-q5_0.bin
whisper-cli -m models/ggml-large-v3-turbo-q5_0.bin -l ru -f test.wav
Для оригинального Whisper на Windows или Linux набор другой: pip install -U openai-whisper внутри виртуального окружения плюс ffmpeg из менеджера пакетов системы. Модель при первом запуске скачается сама в папку ~/.cache/whisper.
Какую модель выбрать для русского?
Коротко: для русского бери large-v3-turbo. Она почти так же точна, как самая большая large-v3, и в разы быстрее. Маленькие модели tiny и base годятся для проверки установки, но не для работы.
У Whisper шесть размеров модели. Таблица ниже собрана из README двух репозиториев: память для оригинала и вес файла для whisper.cpp.
| Модель | Память у оригинала | Файл для whisper.cpp | Для чего |
|---|---|---|---|
| tiny | около 1 ГБ | 75 МБ | проверить, что всё запускается |
| base | около 1 ГБ | 142 МБ | черновик, много ошибок в русском |
| small | около 2 ГБ | 466 МБ | слабая машина, текст вычитывать |
| medium | около 5 ГБ | 1,5 ГБ | перевод речи на английский |
| large-v3 | около 10 ГБ | 2,9 ГБ | максимум точности, медленно |
| large-v3-turbo | около 6 ГБ | 1,5 ГБ, сжатая 547 МБ | основная рабочая модель |
Разницу я проверил на одном и том же файле: 13 секунд русской речи, сгенерированной встроенным голосом Mac. Фраза была такая: «…получаем текст с таймкодами». Модель base услышала «получаем текст стоим-кадами» и «Виспер» вместо Whisper. Сжатая large-v3-turbo выдала всё слово в слово, с правильной пунктуацией и разбивкой на предложения.
Ещё один приём, который я держу в своём скрипте: подсказка с терминами. Whisper не знает, как пишутся CLAUDE.md, MCP или VS Code, и пишет их на слух. У whisper-cli есть ключ prompt: в него кладут пару фраз в духе записи с нужными названиями, и модель берёт их как образец написания. По умолчанию подсказка действует на начало записи, для всей длины есть отдельный ключ carry-initial-prompt.
whisper-cli -m models/ggml-large-v3-turbo-q5_0.bin -l ru -f urok.wav -otxt --prompt "Урок про Claude Code, VS Code, MCP и файл CLAUDE.md."
Один нюанс из README оригинала: модель turbo не обучена переводу. Для перевода русской речи в английский текст бери medium или large.
Я сам плачу за подписки на нейросети картой для подписок «Плати по миру»: выпускается за пару минут, пополняется рублями через СБП. Оформить карту
Команда расшифровки и форматы файлов
Коротко: одна команда на файл. Главное - явно указать русский язык и нужные форматы. Для субтитров бери SRT или VTT, для чтения и конспектов - TXT, для программ - JSON.
Для whisper.cpp рабочая команда выглядит так:
whisper-cli -m models/ggml-large-v3-turbo-q5_0.bin -l ru -f zapis.wav -otxt -osrt -of zapis
Здесь -l ru - русский язык, -otxt и -osrt - сохранить текст и субтитры, -of zapis - имя файлов без расширения. Кроме этих двух whisper-cli умеет VTT, CSV, JSON и LRC, полный список показывает whisper-cli -h. Субтитры пригодятся и для роликов, которые Claude Code собирает кодом в Remotion: у Remotion есть отдельный скилл для субтитров.
Видео whisper-cli не открывает. Сначала вытаскиваем звук, команда взята из README whisper.cpp:
ffmpeg -i video.mp4 -ar 16000 -ac 1 -c:a pcm_s16le zapis.wav
У оригинального Whisper команда длиннее по флагам, зато видео можно отдавать сразу:
whisper video.mp4 --model turbo --language ru --output_format srt --output_dir subs
По умолчанию оригинал сохраняет все форматы сразу: txt, vtt, srt, tsv, json и jsonl. Если нужен один, укажи его в флаге формата, как в команде выше.
Вот как выглядит начало SRT-файла, который я получил:
1
00:00:00,000 --> 00:00:04,000
Привет, это проверка расшифровки речи на своем компьютере.
SRT - самый ходовой формат субтитров, его загружают в видеоредакторы и на видеоплощадки. А TXT удобно сразу отдать агенту: «сделай из этой расшифровки конспект по разделам».
Сколько времени занимает расшифровка?
Коротко: на Mac M1 трёхминутная запись расшифровалась за 32 секунды моделью base и за 72 секунды моделью turbo. Это под сильной нагрузкой, на свободной машине быстрее.
Замер я делал честно, но в неидеальных условиях: параллельно на машине работали другие задачи, средняя загрузка процессора в момент замера держалась около 140. Поэтому цифры считай верхней границей.
| Запись | base | large-v3-turbo q5_0 |
|---|---|---|
| 13 секунд | 4,8 с | 10,9 с |
| 3 минуты 5 секунд | 32 с | 72 с |
Выходит, turbo на M1 работает примерно в 2,5 раза быстрее реального времени: час записи займёт около 25 минут. Запускаешь, идёшь заниматься своими делами, возвращаешься к готовому тексту. Base быстрее, но экономия в пару минут не стоит ошибок, которые потом вычищать руками.
На машине с видеокартой NVIDIA оригинальный Whisper работает быстрее, но у меня такой машины нет, и цифры я не приводил.
Польза появляется после расшифровки. Сырой текст мало кому нужен: из него делают конспект, выжимку для поста, субтитры, базу вопросов клиентов. Пересказывать агенту порядок каждый раз надоедает, поэтому порядок действий упаковывают в скилл, а обработку пачки файлов - в сценарий с субагентами. В курсе ClaudeBase урок «Хуки, скиллы, субагенты и сценарии» разобран ровно на этой задаче: конспекты из расшифровок видео, где агент сам находит файлы без конспекта и обрабатывает их параллельно.
Частые ошибки при расшифровке
Коротко: пять ошибок, на которые натыкаешься в первые полчаса. У каждой понятная причина и короткое лечение.
error: failed to read audio file ‘video.mp4’
whisper-cli не читает видео и форматы кроме flac, mp3, ogg и wav. Переведи звук в WAV 16 кГц командой ffmpeg из раздела выше или попроси агента сделать это.
failed to open ‘models/ggml-base.en.bin’
Программа запустилась без указания модели и ищет файл по умолчанию, английскую base. Укажи свою модель через -m и полный путь к файлу .bin. Если путь относительный, запускай команду из той папки, где лежит models.
Текст пришёл на английском: «Hello, this is the check of…»
Ошибки в терминале нет, но вместо расшифровки получился кривой перевод на английский. У whisper-cli язык по умолчанию английский. Добавь -l ru. Для автоопределения языка есть -l auto, но для русской речи надёжнее указать язык явно.
error: externally-managed-environment
Так отвечает pip, если ставить openai-whisper в системный Python, установленный через Homebrew. Система защищает свой Python от чужих пакетов. Решение - виртуальное окружение: попроси агента создать его в папке проекта и ставить пакеты туда.
zsh: command not found: whisper
Пакет стоит в виртуальном окружении, а окружение не активировано, либо установка не прошла. Попроси агента проверить, где лежит программа, и дать команду запуска с полным путём. Для whisper.cpp программа называется whisper-cli, а не whisper.
Чек-лист рабочей расшифровки
- Выбран вариант: whisper.cpp для Mac и слабых машин, openai-whisper для NVIDIA.
- ffmpeg установлен и отвечает на
ffmpeg -version. - Модель large-v3-turbo скачана, путь к ней известен.
- Тестовый файл на 10-20 секунд расшифрован на русском, без перевода на английский.
- Для видео звук сначала вытаскивается в WAV 16 кГц.
- На выходе есть TXT для чтения и SRT с таймкодами.
- Порядок действий записан в скилл или правила проекта.
Что делать с расшифровками дальше?
Коротко: закрепи расшифровку как постоянный инструмент агента и настрой, что он делает с текстом дальше.
- Сделай из этого скилл. Как устроены скиллы и где их хранить, разобрано в статье про скиллы Claude Code. Одна фраза «расшифруй и сделай конспект» будет запускать всю цепочку.
- Запиши правила. Модель, язык и папку для результатов удобно держать в CLAUDE.md, чтобы агент не переспрашивал.
- Посмотри на другие локальные задачи. Whisper - пример того, как агент ставит и гоняет программы у тебя на машине. Больше таких сценариев в статье про локального ИИ-агента.
Если хочешь, чтобы агент сразу работал по готовым настройкам, загляни в ClaudeBase: там уроки курса с конспектами и расшифровками и рабочая база для подключения по MCP. Через неё агент сам достаёт скиллы, разрешения и правила проекта.