Как устроена облачная диктовка в двух словах
У любой облачной диктовки — голосового ввода Windows, диктовки в Word, голосового ввода в браузере — общая схема: микрофон записывает голос, запись уходит на сервер поставщика услуги, там превращается в текст, а текст возвращается на устройство. Сам механизм и то, чем от этого отличается распознавание на устройстве, разобраны в статье о распознавании речи без интернета — здесь эту часть не повторяем, а разбираем то, что происходит с записью на другом конце: что именно каждый сервис официально обещает по поводу её хранения.
Что пишет Microsoft о голосовом вводе Windows
Голосовой ввод Windows (Windows + H) распознаёт речь через интернет, на серверах речевых сервисов Microsoft Azure — без сети панель не откроется вообще. А вот про судьбу самой записи страница поддержки почти ничего не говорит: она отсылает к общей Политике конфиденциальности Microsoft.
В самой Политике «голосовые данные» определены отдельно: устные запросы, команды или диктовка, включая фоновые звуки. Рядом — ссылка на отдельный документ о том, как Microsoft использует и защищает такие данные в технологиях распознавания речи. По этому документу голосовые клипы хранятся на защищённом зашифрованном сервере и могут время от времени выборочно прослушиваться людьми — чтобы улучшать точность распознавания и обучать модели. Срок хранения — до двух лет, а сами клипы обезличиваются: они не привязываются к учётной записи Microsoft. Участие добровольное: если не дать согласие на использование своих клипов для обучения моделей, голосовым вводом всё равно можно пользоваться как обычно.
В список продуктов, чьи голосовые клипы могут попасть в такую выборку, входит Windows в целом, а также Cortana, SwiftKey, HoloLens, функция перевода голоса в Skype и переводчик Microsoft Translator. Документ говорит о продукте в целом, а не о конкретной кнопке с микрофоном, — поэтому нельзя утверждать, что речь именно о функции голосового ввода Win+H и только о ней.
Диктовка в Word и Office: другое обещание
У функции «Диктовка» в Word и других приложениях Office формулировка иная и заметно конкретнее. По официальной справке Microsoft, эта служба не хранит ни звуковые данные, ни расшифрованный текст: речь отправляется в Microsoft только для того, чтобы вернуть текстовый результат обратно. Тот же документ о защите голосовых данных отдельно оговаривает: приложения и сервисы Office, хотя и имеют голосовые функции, сейчас не отбирают и не прослушивают голосовые клипы клиентов — в отличие от Windows в целом. Условия самой работы функции — подписка Microsoft 365, необходимость интернета — разобраны отдельно в статье про диктовку в Word.
Голосовой ввод Google: обрабатывает не всегда сам Google
С голосовым вводом в Google Документах есть тонкость, которую легко упустить. Официальная справка Google описывает это так: когда вы включаете голосовой ввод, преобразованием речи в текст управляет ваш браузер — именно он определяет, как обрабатывается речь, и передаёт готовый текст в Google Документы. То есть ответ на вопрос «куда уходит мой голос» зависит от того, каким браузером вы пользуетесь, а не только от политики самого сервиса: у разных браузеров эта часть может быть устроена по-разному, и уточнять стоит политику браузера, а не только Google Документов.
Это стоит отличать от другого — от данных голосового помощника Google, который активируется командой «Окей, Google». По общей Политике конфиденциальности Google, при срабатывании такой команды устройство записывает голос и несколько секунд до неё, а часть сохранённых записей может прослушиваться, чтобы улучшать технологии распознавания. Это отдельная настройка и отдельный сценарий, а не то же самое, что голосовой набор текста в документе, — спутать их легко, но правила у них разные.
Чем принципиально отличается распознавание на устройстве
У распознавания прямо на компьютере или телефоне вопрос хранения и выборочного прослушивания не возникает вообще — звук физически не покидает устройство, и его не с чем сравнивать по политикам разных серверов. Как это работает и как проверить самостоятельно, не полагаясь на честное слово, — в статье о распознавании речи без интернета: там же способ проверить через сетевой монитор, уходит ли трафик во время диктовки.
На что смотреть в настройках и в политиках
- Ищите обещание про конкретную функцию, а не про компанию вообще. Фраза «мы серьёзно относимся к приватности» ничего не говорит о том, хранится ли именно ваша запись. У Диктовки в Word и у голосового ввода Windows разные правила, хотя обе функции принадлежат Microsoft.
- Проверьте личный кабинет. В аккаунте Microsoft и в истории активности аккаунта Google можно посмотреть и удалить сохранённые голосовые данные, если они собираются.
- Для веб-сервисов уточните, какой браузер задействован. Если преобразование речи в тексте «управляется браузером», а не самим сайтом, — политика конфиденциальности нужного сайта не единственный документ, который стоит открыть.
- Отличайте голосового помощника от голосового ввода текста. Настройки и обещания у активации голосом и у обычной диктовки в документе не совпадают, даже если обе функции принадлежат одной компании.
- Смотрите на дату документа. Политики конфиденциальности время от времени меняются, и формулировка, которую кто-то процитировал в статье или форуме год назад, может уже не совпадать с действующей — открывайте документ по прямой ссылке, а не пересказ третьих лиц.
Когда это особенно важно
Для короткой заметки самому себе разница между политиками почти не ощущается. Но если в диктуемом тексте — чужие персональные данные, содержимое коммерческой тайны компании или что-то, подпадающее под врачебную или адвокатскую тайну, разумнее решить заранее, каким способом диктовать, а не разбираться с этим постфактум. Речь не про юридические гарантии — правовые рамки у каждого случая свои, и закрыть их одной статьёй не получится, — а про практический выбор инструмента: если формулировка политики облачного сервиса вызывает вопросы, распознавание прямо на устройстве снимает сам вопрос о хранении на сервере, потому что там просто нечему храниться на чужой стороне.
На практике проще всего решить это один раз для конкретного типа документов, а не каждый раз заново. Юрист может диктовать внутренние заметки облачным способом, а формулировки договора — только на устройстве; врач — не задумываться о выборе для личных напоминаний, но иметь отдельное правило для историй болезни. Правило не обязано быть одинаковым для всей работы сразу, важно, чтобы оно вообще было и не менялось от случая к случаю без причины.
Коротко: куда уходит звук
| Функция | Куда уходит звук | Что обещано о хранении |
|---|---|---|
| Голосовой ввод Windows (Win+H) | На сервер Microsoft Azure | Может выборочно прослушиваться для обучения моделей, с согласия, обезличенно, до двух лет |
| Диктовка в Word и Office | На сервер Microsoft | Явно не хранится ни звук, ни расшифрованный текст |
| Голосовой ввод в Google Документах | Определяет браузер | Зависит от политики браузера, а не только Google Документов |
| Распознавание на устройстве, например dictor | Никуда, остаётся на устройстве | Вопрос хранения на сервере не возникает |
dictor устроен по последнему принципу: голос распознаётся прямо на компьютере, не пишется на диск и не отправляется на сервер — подробнее на странице политики конфиденциальности dictor. Это не единственно правильный способ диктовать, а один из вариантов: что выбрать, зависит от того, что именно вы диктуете и насколько для вас важен сам вопрос «куда уходит запись».