Из чего складывается задержка

Путь голоса к тексту у облачного сервиса устроен в несколько шагов, и на каждом можно потерять время:

  • Запись. Микрофон получает звук — этот шаг одинаковый для любого способа распознавания, разницы здесь нет.
  • Кодирование и отправка. Звук сжимается в аудиопоток и уходит по сети на сервер распознавания. У офлайн-варианта этого шага просто не существует: отправлять некуда, звук никуда не выходит.
  • Очередь и обработка на сервере. Если сервер поставщика одновременно обслуживает много пользователей, запрос сначала встаёт в очередь и только потом обрабатывается.
  • Ответ. Готовый текст возвращается обратно по той же сети — и лишь после этого появляется на экране.

У офлайн-распознавания путь короче: запись → обработка сразу на процессоре устройства → текст. Дело не в том, что сервер «медленный», а в том, что у него просто больше мест, где может набежать заминка: сеть в одну сторону, очередь, сеть в обратную сторону. У офлайн-варианта таких мест нет, потому что нет сети как отдельного участка пути.

От чего зависит задержка облачной диктовки

Встроенный голосовой ввод Windows, по данным Microsoft, распознаёт речь через интернет, на серверах обработки Azure, — то есть зависит от сети по определению. У любого такого сервиса на итоговую задержку влияет несколько вещей:

  • Скорость и тип подключения. Домашний или офисный Wi-Fi обычно быстрее и стабильнее мобильного интернета, а слабый сигнал сотовой сети добавляет к обычной задержке ещё и повторные попытки отправки, если пакет данных не дошёл с первого раза.
  • Мобильный интернет в целом. Даже при хорошем сигнале мобильная сеть — это дополнительное звено между устройством и вышкой оператора, которого нет при прямом кабельном подключении.
  • VPN. Трафик идёт через промежуточный сервер, часто в другой стране, и это добавляет свой участок пути поверх обычного запроса к серверу распознавания.
  • Нагрузка на сервер поставщика. В часы пик запрос может ненадолго встать в очередь, прежде чем до него дойдёт обработка, — так же как загруженный сайт открывается на секунду-другую дольше в пиковое время.

Ни один из этих факторов не связан с качеством распознавания как таковым — все они про сеть, через которую идёт звук и обратно идёт текст. На практике причины ещё и складываются, а не действуют по одной: слабый мобильный сигнал плюс включённый VPN плюс час пик у сервиса — и обычная фраза, которая дома отвечает почти мгновенно, в дороге может ощутимо повиснуть. Точную цифру в секундах здесь заранее не назвать — слишком много переменных, — но логика простая: чем больше сетевых звеньев на пути, тем выше шанс, что хотя бы одно из них в моменте окажется медленным.

Когда задержка почти не мешает — и когда мешает всерьёз

Одна короткая фраза раз в час при хорошем интернете — разница между способами едва ощутима, и гнаться здесь не за чем. Совсем другое дело — диктовка весь рабочий день, много фраз подряд одна за другой или слабый сигнал в дороге: тогда лишние секунды на каждую фразу складываются в заметное время ожидания за день, а не остаются разовой мелочью. Про то, как это выглядит именно в поездках и местах с нестабильной сетью, — в статье про голосовой ввод в дороге.

Когда облако всё же оправдано

Задержка — не единственный критерий выбора, и иногда облачный вариант вполне уместен:

  • Разовая короткая диктовка при надёжном интернете, когда не хочется ничего устанавливать, — встроенный голосовой ввод Windows справится без раздумий.
  • Нужен язык или функция, которых нет в конкретной офлайн-программе.
  • Компьютер или телефон не свои, а чужие, и ставить на них что-то отдельное не вариант.

О самом принципе распознавания без интернета — в статье про офлайн-распознавание речи, а о том, почему это часто важно не из-за скорости, а из-за приватности, — в статье про конфиденциальность голосового ввода.

«Текст по ходу речи» и «текст после отпускания клавиши»

У встроенного голосового ввода Windows и у диктовки в Word слова появляются на экране, пока вы ещё говорите, — это называется распознаванием по ходу речи. Удобно тем, что видно прогресс сразу, но у этого есть и обратная сторона: часть уже показанных слов может измениться, когда распознавание получит больше контекста дальше по фразе, — это нормальное свойство потокового распознавания, а не сбой.

У dictor устроено иначе: пока зажата клавиша, на экране не появляется ничего. Отпустили клавишу — и в поле сразу вставляется вся фраза целиком, уже с точками, запятыми и заглавными буквами. Разница не в том, что один способ «правильный»: раз распознавание идёт на самом устройстве, ждать здесь почти нечего — на обычном ноутбуке готовая фраза появляется примерно за 0,2 секунды после отпускания клавиши, и это уже финальный результат, а не промежуточная версия, которая может ещё перестроиться на глазах.

Получается два разных ощущения от одного и того же процесса: потоковое распознавание выглядит «живым», потому что видно, как строится фраза, а вариант с клавишей — как будто мгновенным, потому что видно только готовый результат. Для короткой реплики разница почти не заметна в любом случае. А вот при длинной диктовке — абзац за абзацем — постоянно меняющийся на экране текст потокового распознавания начинает отвлекать: приходится ждать, пока фраза «устаканится», прежде чем читать написанное. Формат с клавишей эту часть попросту убирает: следить за экраном, пока говоришь, не нужно вовсе.

Коротко о главном

СвойствоОблачный голосовой вводОфлайн-распознавание, например dictor
Шагов от голоса до текстаЗапись, отправка, очередь, обработка, ответЗапись и обработка на устройстве
Зависит от интернетаДа, постоянноНет
Мобильная сеть и VPN влияют на скоростьДаНет
Когда виден текстПо ходу речи, может менятьсяСразу после отпускания клавиши, целиком

Ни один из вариантов не «лучше» в общем смысле — у них разное устройство, и задержка тоже разная не случайно, а потому что у облака в принципе больше мест на пути звука, где может набежать время ожидания. Скачать dictor для Windows можно бесплатно, чтобы сравнить самому.