Константин ВасинБлог
Второй мозг и агенты

Голосовой ввод текста на компьютере: что поставить и какое железо нужно

Печатать медленнее, чем говорить, — примерно втрое. При этом почти все программы для голосового ввода просят подписку и отправляют вашу речь на чужой сервер. Обе проблемы снимаются одной установкой: модель распознавания живёт на вашем компьютере, работает офлайн и стоит ноль.

Коротко
  • Голосовой ввод не требует подписки: модель распознавания ставится на компьютер и работает без интернета.
  • Мощный компьютер не нужен. Распознавание речи — самая лёгкая из локальных задач: модель на 0,6 млрд параметров просит около 2 ГБ памяти против 20 ГБ у локальной языковой модели.
  • Разница между Mac и Windows исчезла. Раньше нормальная оболочка была только под Mac; сейчас есть бесплатная с открытым кодом сразу под три системы.
  • Главный выигрыш не в скорости печати, а в том, что мысль доезжает до текста целиком: наговорить абзац проще, чем набрать.
Содержание статьи
  1. Что вообще происходит внутри
  2. Какое железо нужно на самом деле
  3. Что ставить
  4. Куда это встроить, чтобы не осталось игрушкой
  5. Чего ждать не стоит

Скорость обычной речи — примерно 120 слов в минуту. Скорость набора у человека, который не учился слепой печати, — 30–40. Разница в три раза, и она копится каждый день: в заметках, задачах, сообщениях, промптах для агента.

При этом голосовой ввод у большинства ассоциируется с двумя вещами: диктовкой на телефоне и подпиской за расшифровку. Первое неудобно для работы, второе не нужно — модели распознавания давно лежат в открытом доступе и работают на обычном ноутбуке.

Я перестал платить за расшифровку больше года назад. Ниже — что именно стоит у меня, что ставить на Windows и какое железо для этого действительно нужно.

Что вообще происходит внутри

Любая программа голосового ввода — это оболочка над моделью распознавания речи. Оболочка ловит горячую клавишу, пишет звук с микрофона, отдаёт его модели и вставляет полученный текст в активное поле. Вся ценность подписочных сервисов ровно в этом: они запустили открытую модель на своём сервере и берут деньги за удобство.

Моделей, на которых всё это стоит, по сути две.

**Whisper (OpenAI)**

Открытая модель, вышла в 2022 году и стала стандартом. Версии от лёгкой до большой, крупная весит около 3 ГБ. Понимает десятки языков, лучше всех держит грязный звук — шум, дальний микрофон, несколько голосов. На видеокарте или Mac с M-чипом работает быстрее реального времени, на голом процессоре медленнее.

**Parakeet V3 (NVIDIA)**

Модель на 600 миллионов параметров, заточенная под процессор: для загрузки хватает примерно 2 ГБ памяти. Держит 25 европейских языков, включая русский, и определяет язык сама. Смысл её в том, что она даёт приемлемое качество там, где тяжёлый Whisper тормозил бы.

Обе — не облако. Файл скачивается один раз и дальше работает офлайн: в поезде, в самолёте, при отключённом интернете.

Дальше по теме

Стек без подписок, который правда работает

В канале показываю, что стоит на компьютере, что в облаке и сколько это стоит в месяц — вместе с тем, что не прижилось.

Какое железо нужно на самом деле

Это главный вопрос, который мне задают, и на него есть точный ответ: распознавание речи — исключение среди локальных задач. Всё остальное, что запускают дома, упирается в память и разочаровывает; здесь домашнее железо не уступает облаку.

  • Модель распознавания (лёгкая)2 ГБхватает любого рабочего ноутбука
  • Модель распознавания (тяжёлая)3 ГБплюс ускорение на видеокарте или M-чипе
  • Локальная языковая модель на 30b20 ГБи она всё равно слабее облачной

Разница в порядок. Именно поэтому локальные нейросети в роли «замены ChatGPT» разочаровывают, а в роли распознавания речи — работают: задача узкая, модель маленькая, качество упирается не в железо, а в микрофон.

Что реально влияет на качество

Не процессор. Микрофон и дикция. Гарнитура за тысячу рублей у рта даёт заметно более чистый текст, чем встроенный микрофон ноутбука в комнате с эхом. Прежде чем менять модель на тяжёлую, попробуйте сменить микрофон — обычно этого хватает.

Что ставить

На Mac. У меня стоит WhisperNotes — оболочка над Whisper с нормальным интерфейсом: горячая клавиша, диктовка в любое поле, автозапись встреч. Стоит около 500 ₽ разово, не подпиской. Важная деталь: качать нужно с сайта разработчика — версия из App Store урезана и глючит.

На Windows и Linux. Раньше я честно отвечал, что под Windows конкретную программу не порекомендую, потому что сам на ней не работаю. Сейчас ответ есть: Handy — бесплатная оболочка с открытым кодом под все три системы сразу.

Handy: что это по фактам

Открытый код под лицензией MIT, 31 тысяча звёзд на GitHub. Последняя версия — 0.9.6 от 24 августа 2026 года, репозиторий обновлялся сегодня. Собран под Windows (x64 и ARM), macOS (Intel и Apple Silicon) и Linux (deb, rpm, AppImage). Внутри — Whisper на выбор или Parakeet V3, распознавание целиком на вашей машине. Стоит ноль; на сайте есть кнопка пожертвования, и это единственный платёж, который там возможен.

Работает он так: держите горячую клавишу, говорите, отпускаете — текст вставляется туда, где стоял курсор. Тишину в начале и в конце отсекает отдельный детектор голоса, поэтому в текст не попадают паузы на «э-э-э» перед первой фразой.

Автор написал программу после травмы руки, когда ему самому понадобился инструмент, который работает без интернета и который можно поправить под себя. В описании проекта это сформулировано честно: цель не «лучшая программа распознавания», а «самая пригодная для форка». Для нас это значит одно — её не выключат и не переведут на подписку через год.

Порядок установки, если ставите впервые

Скачать сборку под свою систему с сайта проекта и разрешить запуск (первая установка на Mac и Windows потребует подтверждения — приложение подписано не так, как магазинные). Выбрать модель. Начинайте с лёгкой на процессоре: если качество устраивает, тяжёлую можно не ставить вообще. Назначить горячую клавишу на удержание, а не на переключение. Так невозможно забыть выключить запись. Проверить на своей реальной речи: продиктуйте абзац с терминами, именами и цифрами из вашей работы. Тест «раз-два-три» ничего не показывает. Если качество не устроило — сначала микрофон, потом модель потяжелее.

Через агента. Если у вас уже стоит Claude Code или другой консольный помощник, никакая оболочка не обязательна: попросите его поставить Whisper и расшифровать файл. Он скачает модель, подберёт параметры и вернёт текст. Это вариант для разовой расшифровки записи, а не для ежедневной диктовки.

Whisper умеет молча зацикливаться

На длинных файлах с музыкой или долгой тишиной Whisper иногда впадает в петлю: повторяет одну и ту же фразу шагом в тридцать секунд до конца записи. Программа при этом завершается штатно, без единой ошибки, — и вы обнаруживаете пропажу минут речи, только когда читаете расшифровку. Лечится флагом, который отключает условие на предыдущий контекст (-mc 0 в whisper.cpp). Если гоняете расшифровку пачкой — проверяйте вывод на повторы, а не только код возврата.

Куда это встроить, чтобы не осталось игрушкой

Голосовой ввод сам по себе экономит минуты. Пользу он начинает приносить, когда у наговорённого есть адрес.

У меня он такой: мысль или задача наговаривается голосовым сообщением в Telegram, оттуда расшифровка падает в базу знаний, а агент трижды в день разбирает вброшенное по проектам и утром отдаёт план на день. Смысл не в распознавании, а в том, что идея не теряется между «подумал в машине» и «сел за компьютер».

Маршрут одной мысли
  1. 1Голосовоенаговорили на ходу, 20 секунд
  2. 2Расшифровкалокальная модель, без интернета и без подписки
  3. 3База знанийтекст падает в нужный проект, а не в «Загрузки»
  4. 4Разборагент раскладывает по задачам и приоритетам

Второй сценарий, который окупается сразу, — диктовать задачи агенту. Хорошая постановка задачи для модели длинная: контекст, ограничения, что уже пробовали. Печатать такое лень, и в итоге пишется куцый запрос, на который приходит куцый ответ. Наговорить тот же объём — полминуты.

Читайте такжеТранскрибация в текстЗа расшифровку встреч и кружочков многие платят подписку каждый месяц. Это давно не нужно: модель весит около трёх гигабайт, ставится на компьютер и работает бесплатно и без интернета. Разбираю, как это устроено у меня.

Чего ждать не стоит

Распознавание не расставляет смысловые акценты. Оно даёт поток слов с приблизительной пунктуацией, а вычитку никто не отменял: имена, термины и аббревиатуры искажаются регулярно.

Диктовать статьи целиком тоже не выйдет — устная речь и письменная устроены по-разному, наговорённый текст всегда нужно переписывать. Голосовой ввод хорош там, где важна скорость входа, а не форма: заметки, задачи, черновики, промпты, переписка.

И последнее: локальная модель снимает вопрос «куда уехала запись», но не снимает вопрос согласия собеседника. Записывать созвон, потому что технически это стало бесплатно, — плохая причина.

Что забрать из статьи
  1. Начните с лёгкой модели на процессоре: если качества хватает, тяжёлую можно не ставить вообще.
  2. Проверяйте программу на своей реальной речи — с терминами и именами, а не на «раз-два-три».
  3. Горячую клавишу вешайте на удержание, а не на переключение: отпустил — текст вставился, забыть выключить невозможно.
  4. Диктуйте не только заметки, но и задачи агенту: длинный контекст голосом набирается за полминуты.
  5. Расшифровка сама по себе бесполезна — договоритесь заранее, куда она падает и кто её разбирает.
Забрать материал

Гайд «Второй мозг в Claude Code»

Каркас базы знаний и мост памяти: ИИ помнит все проекты и решения. Забрать в боте. Бесплатно, отдаёт бот в Telegram.

Частые вопросы

Нужен ли мощный компьютер для голосового ввода?

Нет. Это самая нетребовательная из локальных задач: лёгкая модель распознавания весит порядка 600 миллионов параметров и просит около 2 гигабайт памяти — столько есть на любом рабочем ноутбуке. Тяжёлые модели Whisper работают заметно быстрее на видеокарте или Mac с M-чипом, но и без них справляются, просто медленнее.

Работает ли голосовой ввод без интернета?

Да, если модель стоит локально. Файл модели скачивается один раз, дальше распознавание идёт на вашем процессоре — в самолёте и в поезде тоже. Онлайн-сервисы без интернета не работают в принципе.

Какая программа для голосового ввода есть на Windows?

Из бесплатных с открытым кодом — Handy: одна программа под Windows, macOS и Linux, распознаёт локально, вставляет текст в активное поле по горячей клавише. На Mac у меня давно стоит платная оболочка WhisperNotes за 500 ₽ разово; под Windows аналогичного платного варианта я не проверял.

Насколько точно распознаётся русская речь?

Текст получается читаемым почти без правки. Спотыкается на именах собственных, терминах и аббревиатурах, пунктуация расставляется приблизительно. Для заметок, задач и черновиков этого достаточно, для публикации текст всё равно вычитывается.

Голосовой ввод и транскрибация — это одно и то же?

Технически да, модель одна. Разница в сценарии: голосовой ввод — это диктовка в поле ввода здесь и сейчас, транскрибация — расшифровка готовой записи созвона или ролика. Оболочки под эти два сценария разные, а модель под ними одна и та же.

Уходит ли моя речь куда-то на сервер?

У локальной программы — нет, обработка идёт на вашем компьютере. Это единственный честный способ диктовать рабочие вещи: содержимое переговоров, цифры, чужие персональные данные. Согласие собеседника на запись это, впрочем, не отменяет.

Константин Васин
Предприниматель, маркетолог

10 лет в маркетинге и онлайн-образовании. Запускаю проекты в одиночку на Claude Code и показываю экономику как есть. Все методы из блога сначала обкатываю на своих проектах и только потом описываю.