Транскрибация встреч, которая идёт прямо во время разговора
На вход — два потока звука: ваш микрофон и звук звонка. На выходе одна расшифровка, где у каждой реплики есть автор. Она пишется по ходу разговора, а не восстанавливается потом из записи.
60 бесплатных минут в месяц · только живые звонки
Ответы ниже — пример. Своя база подключается в приложении.
…
…
Начнём с третьего квартала — что с конверсией?
Конверсия выросла на 14 % — сейчас покажу воронку.
А стоимость лида?
Стоимость лида — €12,40, на 9 % ниже плана. Основной прирост дала органика.
Это не ролик, а сам Whisperer: панель отвечает по-настоящему. Микрофон включается только по вашему нажатию.
Механика
Почему подписи говорящих не врут
Большинство инструментов угадывают говорящего, сравнивая голоса в одной смешанной дорожке. Whisperer угадывать не приходится: два потока не встречаются до самой сборки расшифровки.
- Захват Два раздельных источника Ваш голос приходит с микрофона. Все остальные — из системного звука, того самого, который играют ваши динамики.
- Распознавание Короткие куски, по мере поступления Звук уходит короткими фрагментами, пока вы ещё говорите, и каждый уже несёт метку потока, из которого пришёл.
- Результат Расшифровка на глазах Строки появляются в окне поверх экрана и одновременно становятся контекстом, из которого собирается любой ответ ИИ.
Язык
Язык выбирают до начала, а не после
Распознавание работает на Whisper, а он поддерживает больше 90 языков. Язык сессии — настройка, которую вы выбираете перед звонком: на смешанном созвоне ставьте тот, на котором будут говорить больше, а переключения вокруг него модель вытянет сама.
Если расшифровка вернулась не тем алфавитом, почти всегда причина именно в этом, а не в качестве распознавания.
По сервисам
Механизм один, чем бы вы ни созванивались
Интеграции ни с одним сервисом видеосвязи нет — поэтому нет и списка поддерживаемых. Если приложение играет собеседника в ваших динамиках, он попадёт в расшифровку.
Ограничения
Где это не работает
Оба ограничения следуют из одного решения — распознавание идёт потоком, — и настройкой ни одно не снимается.
Готовую запись загрузить можно: раздел «Встречи» принимает один файл до 25 МБ — mp3, m4a, wav, ogg, flac, aac, а также mp4 и webm, из которых берётся звуковая дорожка. Чего нет — пакетной заливки архива; и минуты она расходует те же, что живой звонок.
Чужие голоса приходят из системного звука. За столом без онлайн-встречи микрофон ноутбука слышит всех сразу, и подписи перестают что-либо значить.
Вопросы
О чём спрашивают первым делом
Whisperer расшифровывает встречу в реальном времени?
Да, и только в реальном времени. Звук уходит на распознавание короткими кусками, пока идёт разговор, и строка появляется в окне через мгновения после того, как её произнесли.
Что происходит с расшифровкой после встречи?
Она сохраняется в истории кабинета с подписями говорящих и отметками времени и становится основой карты встречи. Её можно скопировать или выгрузить обычным текстом либо в Markdown. В режиме без логов после сессии не остаётся ничего.
Можно искать по прошлым расшифровкам?
Да. В истории есть поиск по словам в расшифровках и ответах ИИ, а ассистент отвечает на вопросы о прошлых звонках обычным языком и прикладывает источник.
Нужно ли разрешение организатора?
От сервиса видеосвязи — нет: Whisperer не пользуется его записью и в звонок не заходит. Нужно ли разрешение людей в разговоре — отдельный вопрос, местами правовой, и это решение остаётся за вами.
Почему в расшифровке только мой голос?
Нет доступа к системному звуку. На macOS выдайте разрешение на запись экрана — именно так захватывается вторая сторона. На Windows дополнительных разрешений не нужно, но звонок должен играть через устройство вывода по умолчанию.
Проверьте на звонке, который ничего не решает
Пятнадцати минут с коллегой достаточно. Следите за одним: появились ли обе подписи. Если да, то всему дальнейшему — протоколу, поиску, переводу — хватит того, что есть.