Голосовой ввод текста на компьютере: что поставить и какое железо нужно
Печатать медленнее, чем говорить, — примерно втрое. При этом почти все программы для голосового ввода просят подписку и отправляют вашу речь на чужой сервер. Обе проблемы снимаются одной установкой: модель распознавания живёт на вашем компьютере, работает офлайн и стоит ноль.
- Голосовой ввод не требует подписки: модель распознавания ставится на компьютер и работает без интернета.
- Мощный компьютер не нужен. Распознавание речи — самая лёгкая из локальных задач: модель на 0,6 млрд параметров просит около 2 ГБ памяти против 20 ГБ у локальной языковой модели.
- Разница между Mac и Windows исчезла. Раньше нормальная оболочка была только под Mac; сейчас есть бесплатная с открытым кодом сразу под три системы.
- Главный выигрыш не в скорости печати, а в том, что мысль доезжает до текста целиком: наговорить абзац проще, чем набрать.
Содержание статьи
Скорость обычной речи — примерно 120 слов в минуту. Скорость набора у человека, который не учился слепой печати, — 30–40. Разница в три раза, и она копится каждый день: в заметках, задачах, сообщениях, промптах для агента.
При этом голосовой ввод у большинства ассоциируется с двумя вещами: диктовкой на телефоне и подпиской за расшифровку. Первое неудобно для работы, второе не нужно — модели распознавания давно лежат в открытом доступе и работают на обычном ноутбуке.
Я перестал платить за расшифровку больше года назад. Ниже — что именно стоит у меня, что ставить на Windows и какое железо для этого действительно нужно.
Что вообще происходит внутри
Любая программа голосового ввода — это оболочка над моделью распознавания речи. Оболочка ловит горячую клавишу, пишет звук с микрофона, отдаёт его модели и вставляет полученный текст в активное поле. Вся ценность подписочных сервисов ровно в этом: они запустили открытую модель на своём сервере и берут деньги за удобство.
Моделей, на которых всё это стоит, по сути две.
Открытая модель, вышла в 2022 году и стала стандартом. Версии от лёгкой до большой, крупная весит около 3 ГБ. Понимает десятки языков, лучше всех держит грязный звук — шум, дальний микрофон, несколько голосов. На видеокарте или Mac с M-чипом работает быстрее реального времени, на голом процессоре медленнее.
Модель на 600 миллионов параметров, заточенная под процессор: для загрузки хватает примерно 2 ГБ памяти. Держит 25 европейских языков, включая русский, и определяет язык сама. Смысл её в том, что она даёт приемлемое качество там, где тяжёлый Whisper тормозил бы.
Обе — не облако. Файл скачивается один раз и дальше работает офлайн: в поезде, в самолёте, при отключённом интернете.
Стек без подписок, который правда работает
В канале показываю, что стоит на компьютере, что в облаке и сколько это стоит в месяц — вместе с тем, что не прижилось.
Какое железо нужно на самом деле
Это главный вопрос, который мне задают, и на него есть точный ответ: распознавание речи — исключение среди локальных задач. Всё остальное, что запускают дома, упирается в память и разочаровывает; здесь домашнее железо не уступает облаку.
Разница в порядок. Именно поэтому локальные нейросети в роли «замены ChatGPT» разочаровывают, а в роли распознавания речи — работают: задача узкая, модель маленькая, качество упирается не в железо, а в микрофон.
Что реально влияет на качество
Не процессор. Микрофон и дикция. Гарнитура за тысячу рублей у рта даёт заметно более чистый текст, чем встроенный микрофон ноутбука в комнате с эхом. Прежде чем менять модель на тяжёлую, попробуйте сменить микрофон — обычно этого хватает.
Что ставить
На Mac. У меня стоит WhisperNotes — оболочка над Whisper с нормальным интерфейсом: горячая клавиша, диктовка в любое поле, автозапись встреч. Стоит около 500 ₽ разово, не подпиской. Важная деталь: качать нужно с сайта разработчика — версия из App Store урезана и глючит.
На Windows и Linux. Раньше я честно отвечал, что под Windows конкретную программу не порекомендую, потому что сам на ней не работаю. Сейчас ответ есть: Handy — бесплатная оболочка с открытым кодом под все три системы сразу.
Handy: что это по фактам
Открытый код под лицензией MIT, 31 тысяча звёзд на GitHub. Последняя версия — 0.9.6 от 24 августа 2026 года, репозиторий обновлялся сегодня. Собран под Windows (x64 и ARM), macOS (Intel и Apple Silicon) и Linux (deb, rpm, AppImage). Внутри — Whisper на выбор или Parakeet V3, распознавание целиком на вашей машине. Стоит ноль; на сайте есть кнопка пожертвования, и это единственный платёж, который там возможен.
Работает он так: держите горячую клавишу, говорите, отпускаете — текст вставляется туда, где стоял курсор. Тишину в начале и в конце отсекает отдельный детектор голоса, поэтому в текст не попадают паузы на «э-э-э» перед первой фразой.
Автор написал программу после травмы руки, когда ему самому понадобился инструмент, который работает без интернета и который можно поправить под себя. В описании проекта это сформулировано честно: цель не «лучшая программа распознавания», а «самая пригодная для форка». Для нас это значит одно — её не выключат и не переведут на подписку через год.
Порядок установки, если ставите впервые
Скачать сборку под свою систему с сайта проекта и разрешить запуск (первая установка на Mac и Windows потребует подтверждения — приложение подписано не так, как магазинные). Выбрать модель. Начинайте с лёгкой на процессоре: если качество устраивает, тяжёлую можно не ставить вообще. Назначить горячую клавишу на удержание, а не на переключение. Так невозможно забыть выключить запись. Проверить на своей реальной речи: продиктуйте абзац с терминами, именами и цифрами из вашей работы. Тест «раз-два-три» ничего не показывает. Если качество не устроило — сначала микрофон, потом модель потяжелее.
Через агента. Если у вас уже стоит Claude Code или другой консольный помощник, никакая оболочка не обязательна: попросите его поставить Whisper и расшифровать файл. Он скачает модель, подберёт параметры и вернёт текст. Это вариант для разовой расшифровки записи, а не для ежедневной диктовки.
Whisper умеет молча зацикливаться
На длинных файлах с музыкой или долгой тишиной Whisper иногда впадает в петлю: повторяет одну и ту же фразу шагом в тридцать секунд до конца записи. Программа при этом завершается штатно, без единой ошибки, — и вы обнаруживаете пропажу минут речи, только когда читаете расшифровку. Лечится флагом, который отключает условие на предыдущий контекст (-mc 0 в whisper.cpp). Если гоняете расшифровку пачкой — проверяйте вывод на повторы, а не только код возврата.
Куда это встроить, чтобы не осталось игрушкой
Голосовой ввод сам по себе экономит минуты. Пользу он начинает приносить, когда у наговорённого есть адрес.
У меня он такой: мысль или задача наговаривается голосовым сообщением в Telegram, оттуда расшифровка падает в базу знаний, а агент трижды в день разбирает вброшенное по проектам и утром отдаёт план на день. Смысл не в распознавании, а в том, что идея не теряется между «подумал в машине» и «сел за компьютер».
- 1Голосовоенаговорили на ходу, 20 секунд
- 2Расшифровкалокальная модель, без интернета и без подписки
- 3База знанийтекст падает в нужный проект, а не в «Загрузки»
- 4Разборагент раскладывает по задачам и приоритетам
Второй сценарий, который окупается сразу, — диктовать задачи агенту. Хорошая постановка задачи для модели длинная: контекст, ограничения, что уже пробовали. Печатать такое лень, и в итоге пишется куцый запрос, на который приходит куцый ответ. Наговорить тот же объём — полминуты.
Читайте такжеТранскрибация в текстЗа расшифровку встреч и кружочков многие платят подписку каждый месяц. Это давно не нужно: модель весит около трёх гигабайт, ставится на компьютер и работает бесплатно и без интернета. Разбираю, как это устроено у меня.Чего ждать не стоит
Распознавание не расставляет смысловые акценты. Оно даёт поток слов с приблизительной пунктуацией, а вычитку никто не отменял: имена, термины и аббревиатуры искажаются регулярно.
Диктовать статьи целиком тоже не выйдет — устная речь и письменная устроены по-разному, наговорённый текст всегда нужно переписывать. Голосовой ввод хорош там, где важна скорость входа, а не форма: заметки, задачи, черновики, промпты, переписка.
И последнее: локальная модель снимает вопрос «куда уехала запись», но не снимает вопрос согласия собеседника. Записывать созвон, потому что технически это стало бесплатно, — плохая причина.
- Начните с лёгкой модели на процессоре: если качества хватает, тяжёлую можно не ставить вообще.
- Проверяйте программу на своей реальной речи — с терминами и именами, а не на «раз-два-три».
- Горячую клавишу вешайте на удержание, а не на переключение: отпустил — текст вставился, забыть выключить невозможно.
- Диктуйте не только заметки, но и задачи агенту: длинный контекст голосом набирается за полминуты.
- Расшифровка сама по себе бесполезна — договоритесь заранее, куда она падает и кто её разбирает.
Гайд «Второй мозг в Claude Code»
Каркас базы знаний и мост памяти: ИИ помнит все проекты и решения. Забрать в боте. Бесплатно, отдаёт бот в Telegram.
Частые вопросы
Нужен ли мощный компьютер для голосового ввода?
Нет. Это самая нетребовательная из локальных задач: лёгкая модель распознавания весит порядка 600 миллионов параметров и просит около 2 гигабайт памяти — столько есть на любом рабочем ноутбуке. Тяжёлые модели Whisper работают заметно быстрее на видеокарте или Mac с M-чипом, но и без них справляются, просто медленнее.
Работает ли голосовой ввод без интернета?
Да, если модель стоит локально. Файл модели скачивается один раз, дальше распознавание идёт на вашем процессоре — в самолёте и в поезде тоже. Онлайн-сервисы без интернета не работают в принципе.
Какая программа для голосового ввода есть на Windows?
Из бесплатных с открытым кодом — Handy: одна программа под Windows, macOS и Linux, распознаёт локально, вставляет текст в активное поле по горячей клавише. На Mac у меня давно стоит платная оболочка WhisperNotes за 500 ₽ разово; под Windows аналогичного платного варианта я не проверял.
Насколько точно распознаётся русская речь?
Текст получается читаемым почти без правки. Спотыкается на именах собственных, терминах и аббревиатурах, пунктуация расставляется приблизительно. Для заметок, задач и черновиков этого достаточно, для публикации текст всё равно вычитывается.
Голосовой ввод и транскрибация — это одно и то же?
Технически да, модель одна. Разница в сценарии: голосовой ввод — это диктовка в поле ввода здесь и сейчас, транскрибация — расшифровка готовой записи созвона или ролика. Оболочки под эти два сценария разные, а модель под ними одна и та же.
Уходит ли моя речь куда-то на сервер?
У локальной программы — нет, обработка идёт на вашем компьютере. Это единственный честный способ диктовать рабочие вещи: содержимое переговоров, цифры, чужие персональные данные. Согласие собеседника на запись это, впрочем, не отменяет.