Расширение для Chrome · ключ модели остаётся у вас
Vkladka

Голосовой ввод

Голосовой ввод и озвучивание ответа

Диктовать можно во время работы агента, а слушать ответ — системным голосом браузера или сетевым, если включить это отдельно.

Диктовка

Поправка во время работы не прерывает её

Если агент уже выполняет задачу, а человек начинает диктовать, подпись меняется на «Слушаю поправку — работа не прервётся». Распознавание идёт непрерывно и не останавливает то, что уже запущено.

Озвучивание

По умолчанию — голос браузера, не сеть

Сетевой синтез речи выключен, пока человек не включит его сам: без этого ответ читает системный голос браузера, ничего не отправляя наружу. Сетевой вариант звучит естественнее, но это отправка текста ответа стороннему сервису синтеза.

Граница

4000 знаков на фразу, при ошибке — откат

Сетевой синтез режет фразу длиннее 4000 знаков и при любой ошибке — обрыв сети, отказ сервиса — сам переключается обратно на системный голос, а не молчит. Где ещё расширение выбирает между локальным и сетевым, — в локальной модели.

Как это делается

Сетевой голос — Yandex SpeechKit

Сетевое озвучивание работает через SpeechKit: голосов на выбор четыре, все мужские. Нужны сразу два значения — ключ и идентификатор папки в Яндекс Облаке, без второго синтез не запустится. Доступ к адресу синтеза расширение запрашивает не при установке, а в момент, когда человек сам включает эту настройку. Оба режима — и диктовка, и сетевое озвучивание — работают только на русском: язык зашит в коде как ru-RU, переключателя на другой язык в настройках нет.

Где граница

Диктовка никуда не отправляется

Голосовой ввод превращает речь в текст сам браузер: звук не попадает ни на сервер Vkladka, ни в модель. Наружу вообще ничего не уходит, пока человек не включит отдельно сетевое озвучивание ответа. Даже после этого отправляется только готовый текст ответа, а не то, что было сказано голосом. Пока вы говорите, в поле уже видны промежуточные слова, а не только окончательный текст после паузы — распознавание показывает черновик прямо на лету.

Продиктуйте первую задачу вместо ввода текстом

Голос читает браузер сам, пока вы не включите сетевой синтез.