Solaris AI ClubОбсудить проект
Главная / Блог / Надиктовка голосом: самый недооценённый …

Надиктовка голосом: самый недооценённый ускоритель работы с AI

2026-07-23 · Антон Баранов · Solaris AI
Надиктовка голосом: самый недооценённый ускоритель работы с AI

Меня зовут Антон Баранов, я основатель Solaris AI. Вокруг работы с нейросетями выросла целая индустрия усложнения. Люди учат промпт-инжиниринг, строят цепочки, где одна нейросеть пишет промпт, вторая его собирает, третья проверяет. Скажу прямо: в большинстве задач это полный бред и переусложнение. Самый сильный ускоритель лежит на поверхности, он до смешного простой, и почти никто им не пользуется системно. Это надиктовка голосом.

Нейросеть понимает вас лучше, когда вы говорите

Когда вы печатаете, вы экономите на словах. Получается сухой, рубленый промпт, из которого модель вынуждена додумывать контекст. Когда вы говорите, вы естественно даёте больше: интонацию мысли, оговорки, уточнения, полную картину задачи. Парадокс в том, что живая устная речь несёт для модели больше смысла, чем аккуратно составленный короткий текст. Вам не нужно быть промпт-инженером. Нужно просто рассказать нейросети, чего вы хотите, теми же словами, что и живому помощнику.

Добавьте к этому скорость. Всё, что вы пишете за день, письма, сообщения, промты, брифы, комментарии в задачах, можно наговорить в разы быстрее. За неделю это десятки освобождённых часов.

Что говорят цифры и исследования

Это не ощущение, а измеримый факт. Комфортная скорость речи у человека это 130 до 160 слов в минуту. Скорость набора на клавиатуре у обычного пользователя около 40 слов в минуту, у уверенно печатающего 60 до 70. Уже на этом разрыв получается в два с половиной до четырёх раз, а если добавить время, которое вы обычно тратите на правку и переформулирование, реальный выигрыш доходит до пяти раз.

Самое известное измерение провели в Стэнфордском университете вместе с Baidu ещё в 2016 году. Тогда сравнили голосовой ввод и набор на смартфоне: диктовка оказалась примерно в три раза быстрее печати, и при этом с меньшим числом ошибок, а не большим, как принято думать. С тех пор распознавание шагнуло далеко вперёд. Современная модель Whisper-large-v3-turbo даёт точность, близкую к человеческой, и уверенно держит русский язык, термины и имена.

Вывод простой: печатать руками сегодня это осознанный отказ от бесплатного ускорения в несколько раз.

Почему это до сих пор недооценено

У надиктовки дурная репутация из прошлого. Раньше распознавание ошибалось, а на выходе получалась каша из слов без знаков препинания, с «эээ», «ну» и повторами, которую потом дольше править, чем набрать заново. Поэтому многие попробовали один раз и бросили.

Сегодня это другая технология. Современное распознавание уверенно работает на русском, понимает термины, имена и длинные мысли. А поверх него вторая модель причёсывает текст: расставляет пунктуацию и заглавные, убирает слова-паразиты и повторы, приводит к нужному стилю. На выходе не черновик, а чистый связный текст, который не нужно переписывать за собой.

Как это работает в GiG Dictate

Мы собрали такой инструмент и назвали его GiG Dictate. Принцип максимально простой. Вы ставите курсор в любое поле, зажимаете глобальную клавишу F8, говорите и отпускаете. Готовый текст вставляется прямо туда, где стоял курсор. Приложение не важно: чат, почта, документ, поле в браузере, редактор кода, окно с нейросетью.

Под капотом две модели. Распознавание речи делает Whisper-large-v3-turbo, обработку текста Llama. А ещё есть режимы под ситуацию: обычный, деловой, чат, код, промт и английский. Один и тот же надиктованный текст в режиме делового письма и в режиме сообщения в чат звучит по-разному, потому что подстраивается под контекст.

- Пишете письмо — режим «Деловой», текст приходит вежливым и структурированным.

- Отвечаете в мессенджере — режим «Чат», коротко и по-человечески.

- Формулируете задачу нейросети — режим «Промт», мысль оформляется в понятный запрос.

- Диктуете код или термины — отдельный режим не ломает написание.

Личный пример: как пятеро тащат объём большой компании

Я рассказываю это не в теории. За последние полгода мы на таком подходе выпустили больше двадцати AI-агентов и оркестраторов и ведём больше восьми проектов, в том числе международные. Среди них AI-Совет директоров из одиннадцати управленцев, AI-автопостер, который сам пишет и публикует контент, Суверенный AI на своём сервере, лидген-агент GiG Sender и целый маркетплейс агентов. Внутри у нас работает система из сорока восьми агентов, где каждый отвечает за свою зону, а управляет ими одно ядро. И всё это делает мини-команда из пяти человек.

Такой выход возможен ровно потому, что мы не тратим время на печать. Задачи, промты, брифы, сценарии и тексты для агентов мы наговариваем. Один человек голосом за день формулирует столько, сколько раньше отдел писал бы неделю. Надиктовка это не мелкий лайфхак, это то, что физически позволяет крошечной команде держать объём большой компании. Инструмент, которым мы пользуемся сами каждый день, мы и собрали в GiG Dictate.

Простая привычка, которая меняет темп работы

Ценность здесь не в технологии саму по себе, а в новой привычке. Как только вы перестаёте печатать и начинаете проговаривать, скорость всей текстовой работы вырастает в разы, а усталость от клавиатуры уходит. Это не про то, чтобы стать гуру промптов. Это про то, чтобы просто разговаривать с компьютером и получать готовый результат.

Оплата у инструмента честная, за минуты аудио, без подписки, а на старте есть бесплатный баланс, чтобы распробовать на реальной работе. Начните с одного дня: весь день не печатайте, а наговаривайте. К вечеру вы поймёте, почему я называю это самым недооценённым ускорителем.

Частые вопросы

Что быстрее, печатать или диктовать голосом?
Диктовка выигрывает в несколько раз: человек комфортно говорит 130-160 слов в минуту, а печатает в среднем около 40, опытный пользователь 60-70. Если учесть ещё и время на правки, выигрыш может достигать пятикратного. Исследование Стэнфорда и Baidu 2016 года показало, что голосовой ввод на смартфоне примерно втрое быстрее набора, причём с меньшим количеством ошибок.
Хорошо ли нейросеть распознаёт русскую речь при диктовке?
Да, современные модели вроде Whisper-large-v3-turbo распознают русский с точностью, близкой к человеческой, включая термины и имена. Плохая репутация диктовки идёт из прошлого, когда на выходе получался текст без пунктуации, с повторами и словами-паразитами. Сейчас поверх распознавания работает вторая модель, которая расставляет знаки препинания, убирает мусор и приводит текст к нужному стилю.
Нужно ли учить промпт-инжиниринг, чтобы работать с нейросетями?
Для большинства задач нет, и автор статьи считает сложные схемы с цепочками нейросетей переусложнением. Устная речь естественно передаёт модели больше контекста, чем короткий печатный запрос: оговорки, уточнения, полную картину задачи. Достаточно рассказать нейросети, что вам нужно, теми же словами, какими вы объяснили бы живому помощнику.
Как работает голосовой ввод текста в GiG Dictate?
Вы ставите курсор в любое поле, зажимаете клавишу F8, говорите, и после отпускания готовый текст вставляется прямо в это место, будь то почта, мессенджер, документ или редактор кода. Речь распознаёт Whisper-large-v3-turbo, а обработкой текста занимается Llama. Есть режимы под ситуацию: деловой, чат, код, промт и английский, поэтому один и тот же надиктованный текст оформляется по-разному в зависимости от контекста. Оплата идёт за минуты аудио без подписки, а на старте даётся бесплатный баланс.

Внедрить AI в свой бизнес

Solaris проектирует и внедряет ИИ-решения: корпоративные ассистенты на данных компании, ИИ-агенты для продаж и продвижение в поиске и нейросетях. По теме статьи: внедрение искусственного интеллекта, пилот на одном процессе от 40 000 ₽.

внедрение искусственного интеллекта в бизнес
Нейросети из наших статей доступны без VPN и за рубли на платформе GiG AI: Suno v5 — музыка и вокал, Claude — документы и код, Veo 3.1 — видео со звуком.