Константин ВасинБлог
Второй мозг и агенты

Транскрибация аудио в текст: бесплатно и на своём компьютере

За расшифровку встреч и кружочков многие платят подписку каждый месяц. Это давно не нужно: модель весит около трёх гигабайт, ставится на компьютер и работает бесплатно и без интернета. Разбираю, как это устроено у меня.

Коротко
  • Подписка за расшифровку не нужна: модель весит около 3 ГБ, ставится на компьютер и работает без интернета.
  • Распознавание речи — исключение среди локальных задач: здесь домашнее железо не уступает облаку.
  • Сама расшифровка бесполезна. Ценность появляется, когда текст попадает в базу знаний и разбирается на факты и решения.
  • Диктовать задачи быстрее, чем печатать, и качество ответа модели при этом выше.
Содержание статьи
  1. Что именно ставить
  2. Сколько это занимает
  3. Главное — что делать с расшифровкой дальше
  4. Что не стоит ждать
  5. Куда это встраивается

Многие платят за расшифровку аудио ежемесячную подписку. Я выяснил это, когда рассказал в канале, что не плачу за это ничего уже больше года.

Смысл простой: модели распознавания речи давно выложены в открытый доступ, весят около трёх гигабайт и работают прямо на вашем компьютере — без интернета, без лимита минут и без отправки записей куда-либо.

Что именно ставить

Модель называется Whisper. Вариантов установки три, по возрастанию удобства.

Через консоль. Самый быстрый путь, если у вас уже стоит агент-помощник — Claude Code, Codex или похожий: попросите его установить Whisper и расшифровать файл. Он скачает модель, подберёт параметры и отдаст текстовый файл. Никаких команд помнить не нужно.

Оболочкой на Mac. Я пользуюсь приложением WhisperNotes — это надстройка над той же моделью с нормальным интерфейсом: горячая клавиша, диктовка в любое поле, автозапись встреч. Стоит около 500 ₽ разово. Важная деталь: качать нужно с сайта разработчика, версия из App Store урезана и глючит.

На Windows аналогичные оболочки тоже есть, но я на Windows не работаю и конкретную не рекомендую — проверьте сами перед покупкой.

Почему подписка здесь не нужна

Топовая модель весит около 3 ГБ и умеет десятки языков сразу. Один раз скачали — расшифровываете сколько угодно часов. Любая ежемесячная плата за транскрибацию — это плата за то, что кто-то запустил ту же открытую модель на своём сервере.

Дальше по теме

Инструменты, которые правда использую

В канале показываю рабочий стек без подписок: что стоит на компьютере, что в облаке и сколько это стоит в месяц.

Сколько это занимает

На Mac с M-чипом расшифровка идёт быстрее, чем длится запись: часовой созвон превращается в текст за считанные минуты. На обычном ноутбуке медленнее, но всё равно приемлемо — это как раз та задача, где домашнее железо справляется.

Важно: распознавание речи — исключение среди локальных моделей. Всё остальное на домашнем компьютере работает заметно хуже облачных сервисов, я проверял это отдельно и подробно (об этом — в статье про локальные нейросети). Но именно с речью локальная модель ничем не уступает платной.

Путь от голоса до нужной заметки
  1. 1ЗаписьДиктофон, созвон, кружочек — что угодно с речью
  2. 2РасшифровкаЛокальная модель отдаёт текст, быстрее чем длится запись
  3. 3ПапкаТекст сразу ложится в базу знаний, а не в «Загрузки»
  4. 4РазборРаз в неделю модель вытаскивает решения, обещания и факты
  5. 5ЗаметкиСмысл раскладывается по местам, расшифровка больше не нужна

Главное — что делать с расшифровкой дальше

Сама по себе расшифровка бесполезна: это стена текста, которую никто не перечитывает. Ценность появляется, когда текст попадает в систему.

У меня устроено так: диктофон пишет встречу, оболочка автоматически кладёт расшифровку в папку внутри моей базы знаний, а раз в неделю я прошу модель разобрать эту папку — вытащить решения, обещания и факты и разложить по нужным заметкам. Сама расшифровка после этого никому не нужна, нужен извлечённый смысл.

Диктовка вместо печати

Задачи модели я почти не печатаю — диктую. Проговорить абзац контекста голосом занимает секунд двадцать, набрать то же самое руками — минуты три. За день это заметная разница, а качество ответа выше: голосом человек естественно даёт больше подробностей, чем когда экономит нажатия клавиш.

Как поставить у себя за вечер

  1. Поставьте модель — руками или попросив Claude Code это сделать.
  2. Проверьте на одном файле: качество русской речи, скорость, формат вывода.
  3. Настройте, куда складываются расшифровки, — лучше сразу в папку базы знаний, а не в «Загрузки».
  4. Заведите правило разбора: раз в неделю или по запросу, но обязательно с превращением текста в заметки.
  5. Отмените подписку на облачный сервис, если она была.

Что не стоит ждать

Расшифровка не расставит смысловые акценты и не отличит важное от болтовни. Пунктуация будет приблизительной, имена и термины местами исказятся. Если текст идёт в публикацию — его нужно вычитывать и переписывать, здесь помогает отдельный подход к редактуре.

И ещё: расшифровка чужих разговоров без предупреждения — плохая идея независимо от того, локальная модель или облачная. Локальная только снимает вопрос «куда уехала запись», но не вопрос согласия.

Читайте такжеВторой мозгВнешняя память для проектов и решений, к которой подключён ИИ. Разбираю структуру, которая у меня работает на шести проектах, и объясняю, почему большинство таких систем умирает через месяц.

Куда это встраивается

Транскрибация — нижний слой личной системы. Голос превращается в текст, текст попадает в базу знаний, база знаний становится контекстом для модели, а дальше модель работает уже с вашими фактами, а не с общими рассуждениями из интернета.

Если базы знаний ещё нет — начните с неё: Obsidian с нуля.

Что забрать из статьи
  1. Не помните команд — попросите агента поставить модель и расшифровать файл: он подберёт параметры сам.
  2. Складывайте расшифровки сразу в папку базы знаний, а не в «Загрузки».
  3. Заведите правило разбора: расшифровка без превращения в заметки — мусор.
  4. Для публикации текст всё равно вычитывается: пунктуация приблизительная, термины искажаются.
  5. Локальная модель снимает вопрос «куда уехала запись», но не вопрос согласия собеседника.
Забрать материал

Гайд «Второй мозг в Claude Code»

Каркас базы знаний и мост памяти: ИИ помнит все проекты и решения. Забрать в боте. Бесплатно, отдаёт бот в Telegram.

Частые вопросы

Чем расшифровать аудио в текст бесплатно?

Локальной моделью Whisper. Она ставится на компьютер, работает без интернета и без ограничений по минутам. Платить нужно только за удобную оболочку, если не хотите работать через консоль, — и то это разовая покупка, а не подписка.

Нужен ли мощный компьютер?

Нет. Распознавание речи — самая нетребовательная из локальных задач: с ней справляется обычный ноутбук. На Mac с M-чипом расшифровка идёт быстрее реального времени.

Насколько точная расшифровка русской речи?

Крупные модели Whisper дают текст, который читается почти без правки: имена собственные и термины иногда искажаются, пунктуация расставляется приблизительно. Для заметок и поиска по смыслу этого достаточно, для публикации текст нужно вычитывать.

Можно ли расшифровать видео, а не только аудио?

Да, дорожка вытаскивается из видеофайла автоматически. Так удобно разбирать длинные вебинары и созвоны: получаете текст и ищете по нему нужный кусок, вместо того чтобы перематывать запись.

Зачем вообще расшифровывать, если можно послушать?

Текст ищется, режется и передаётся модели. Час записи читается за пять минут, а расшифровка встречи, положенная в базу знаний, потом сама всплывает в нужный момент — этого никакая аудиозапись не даёт.

Константин Васин
Предприниматель, маркетолог

10 лет в маркетинге и онлайн-образовании. Запускаю проекты в одиночку на Claude Code и показываю экономику как есть. Все методы из блога сначала обкатываю на своих проектах и только потом описываю.