轉錄與說話人
Whisperer 使用 Whisper(OpenAI 的多語言模型)即時轉錄語音。說話人區分同步進行:使用者的發言和對方的發言以不同標籤區分,使轉錄更易閱讀,並提高 AI 回覆的準確性。
何時閱讀本文
閱讀本文以瞭解:
- 如何配置識別語言;
- 為何某些發言標註為 [Me],另一些標註為 [Other];
- 支援哪些語言以及如何切換語言。
轉錄的工作原理
Whisperer 捕獲兩路音訊流:
| 音訊流 | 來源 | 標籤 |
|---|---|---|
| 使用者聲音 | 麥克風 | [Me] |
| 對方聲音 | 系統音訊(macOS 需要螢幕錄製權限 / Windows 系統音訊) | [Other] |
每個音訊塊(約 0.8 秒)連同說話人標籤一併傳送到伺服器,獨立進行識別。結果即時顯示在 LiveTranscriptStrip 中——覆蓋層底部的滾動字幕條。
轉錄語言
識別語言在會話級別設定:
- 開啟客戶端中的設定(齒輪圖示)或網頁控制檯。
- 找到轉錄語言欄位。
- 從標準語言程式碼列表中選擇所需語言(例如
en、ru、zh、de)。 - 開始新會話——語言將應用於該會話。
Whisper 支援超過 90 種語言。如果會議參與者使用不同語言,Whisper 會在所選語言"提示"範圍內自動檢測每個音訊塊的語言。
控制檯中的完整轉錄
會話結束後,完整轉錄可在網頁控制檯的歷史記錄部分檢視。你可以:
- 按說話人篩選閱讀;
- 全部或部分複製;
- 作為分析和思維導圖的基礎資料使用。
常見錯誤
| 錯誤 | 原因 | 解決方法 |
|---|---|---|
| 對方聲音未被轉錄 | 未授予螢幕錄製權限(macOS)或系統音訊不可用(Windows) | macOS 權限 / Windows |
| 轉錄中語言錯誤 | 選擇了錯誤的轉錄語言 | 在設定中更改語言並重啟會話 |
| 文字在說話人之間混淆 | 麥克風同時捕獲了兩路音訊(回聲) | 使用耳機或降低揚聲器音量 |
| 網路較差時沒有文字 | WebSocket 在 Whisper 返回結果前斷開 | 改善網路連線;Whisperer 會自動重連 |
最佳實踐
- 使用耳機 — 可消除回聲,改善說話人分離效果。
- 在會話前選擇正確的語言 — 錄製中途更改語言會建立新會話。
- 雙語通話時,可以選擇對方的語言:Whisper 依然能借助上下文提示識別你的語音。