Три разных вещи под одним названием

Когда говорят «голосовой ввод в браузере», обычно имеют в виду одно из трёх:

  • Микрофон на самом сайте — кнопка, которую разработчик добавил в форму поиска, чат или редактор. Технически это Web Speech API — встроенный в браузер механизм, которым может воспользоваться любой сайт.
  • Голосовая функция самого браузера — например, голосовой помощник в Яндекс Браузере. Это делает браузер, а не сайт, и работает не в любом поле, а в своём интерфейсе.
  • Голосовой ввод Windows — клавиши Windows + H печатают текст в любое окно, включая браузер, но это функция операционной системы, а не браузера. Подробнее — в статье про голосовой ввод на компьютере с Windows.

Дальше — про первое и второе: что даёт сама технология в браузере и почему её не видно на каждом сайте.

Почему на одних сайтах есть микрофон, а на других — нет

Технология, которая позволяет сайту слушать голос, называется Web Speech API. Она даёт странице возможность распознавать голос из аудиопотока — но сама по себе ничего не показывает пользователю. Кнопку с микрофоном, подсказку «Говорите» и то, куда вставить распознанный текст, добавляет разработчик сайта собственным кодом.

Отсюда и разница между сайтами: там, где решили встроить голосовой ввод — в поиске, чате, форме обратной связи, — микрофон появляется. Там, где не добавили, голосового ввода не будет, даже если браузер способен его поддержать технически.

Есть и вторая причина — сама технология поддерживается не одинаково. По данным о совместимости браузеров на MDN, Chrome распознаёт речь с префиксом webkit начиная с версии 33, браузеры на основе Chrome, включая Microsoft Edge, наследуют эту поддержку, а Safari поддерживает функцию с версии 14.1, тоже с префиксом. Firefox распознавание речи по умолчанию не включает. Поэтому один и тот же код с микрофоном может молчать в одном браузере и работать в другом.

Куда уходит звук при распознавании

MDN прямо описывает механику: по умолчанию распознавание речи на веб-странице использует серверный движок, звук отправляется в веб-сервис для обработки — и поэтому не работает офлайн. В переводе на бытовой язык: в большинстве браузеров, включая Chrome, произнесённая фраза уходит на сервер разработчика браузера — у Chrome это инфраструктура Google — там превращается в текст и возвращается на страницу.

В спецификации появилось и свойство для локальной обработки прямо на устройстве, но, по той же документации MDN, это возможность с ограниченной поддержкой — не то, что уже работает во всех браузерах массово. Практический вывод простой: голосовой ввод на сайте почти всегда означает, что в момент распознавания звук уходит на сервер того, кто делает браузер.

Голосовой помощник браузера — не то же самое

У некоторых браузеров есть собственный голосовой помощник, и это отдельная история. В Яндекс Браузере для Windows есть Алиса: по официальной справке, её включают фразой «Слушай, Алиса» или нажатием на значок голосового поиска на новой вкладке. Но это не голосовой ввод текста в произвольное поле сайта, а помощник, который ищет информацию и отвечает в своём интерфейсе — он не умеет печатать продиктованное в форму, которую вы заполняете на стороннем сайте.

Разница практическая: если на сайте нет собственной кнопки микрофона, голосовой помощник браузера её не заменит.

Ограничения, с которыми стоит считаться

  • Интернет. Раз звук уходит на сервер, без сети распознавание в браузере не работает — ни на сайте с микрофоном, ни в голосовом помощнике.
  • Поддержка браузером. Firefox не включает Web Speech API по умолчанию — готовый голосовой ввод на сайте там просто не сработает, даже если сайт его добавил.
  • Разрешение на микрофон. Браузер спросит доступ при первом запросе — без разрешения распознавание не начнётся.
  • Качество звука. Как и в любом распознавании речи, результат зависит от микрофона, фонового шума и темпа речи — это общее правило, не особенность конкретного сайта.

Как вводить голосом в любое поле сайта, а не только там, где есть микрофон

Если нужного микрофона на сайте нет, есть два способа, которые не зависят от того, что встроил в сайт его разработчик:

  • Голосовой ввод Windows. Windows + H работает в любом текстовом поле, включая браузер: для системы это обычное окно, как любое другое. Функция использует сервис Microsoft, поэтому интернет всё равно нужен. Подробный разбор — в статье про встроенную диктовку Windows.
  • Отдельная программа распознавания речи, например dictor, вставляет продиктованный текст туда, где стоит курсор, — в браузере, в почте, в редакторе, без разницы. Для такой программы браузер не особый случай: она печатает в активное окно Windows, а не встраивается в код конкретного сайта. При этом распознавание идёт на самом компьютере, без отправки звука на сервер.

Разница на практике простая: микрофон на сайте — решение конкретного сайта, и работает он только там. Win+H и отдельная программа — решение уровня системы, и оно работает в любом окне, включая любой сайт в любом браузере.

Коротко о главном

СпособКто включаетГде работаетНужен интернет
Микрофон на сайте (Web Speech API)Разработчик сайтаТолько это поле на этом сайтеДа
Голосовой помощник браузера (например, Алиса)БраузерСвой интерфейс поиска и ответовДа
Win+H или отдельная программаWindows или сама программаЛюбое окно, включая любой сайтWin+H — да, офлайн-программа — нет

Если голосовой ввод нужен там, где сайт его не предусмотрел, логичнее рассчитывать не на конкретный сайт, а на решение уровня системы. Скачать dictor для Windows можно бесплатно: 2000 слов диктовки в неделю без ограничений по сайтам и программам.