轉錄與說話人

Whisperer 使用 Whisper(OpenAI 的多語言模型)即時轉錄語音。說話人區分同步進行:使用者的發言和對方的發言以不同標籤區分,使轉錄更易閱讀,並提高 AI 回覆的準確性。

何時閱讀本文

閱讀本文以瞭解:

  • 如何配置識別語言;
  • 為何某些發言標註為 [Me],另一些標註為 [Other];
  • 支援哪些語言以及如何切換語言。

轉錄的工作原理

Whisperer 捕獲兩路音訊流:

音訊流 來源 標籤
使用者聲音 麥克風 [Me]
對方聲音 系統音訊(macOS 需要螢幕錄製權限 / Windows 系統音訊) [Other]

每個音訊塊(約 0.8 秒)連同說話人標籤一併傳送到伺服器,獨立進行識別。結果即時顯示在 LiveTranscriptStrip 中——覆蓋層底部的滾動字幕條。

轉錄語言

識別語言在會話級別設定:

  1. 開啟客戶端中的設定(齒輪圖示)或網頁控制檯。
  2. 找到轉錄語言欄位。
  3. 從標準語言程式碼列表中選擇所需語言(例如 enruzhde)。
  4. 開始新會話——語言將應用於該會話。

Whisper 支援超過 90 種語言。如果會議參與者使用不同語言,Whisper 會在所選語言"提示"範圍內自動檢測每個音訊塊的語言。

控制檯中的完整轉錄

會話結束後,完整轉錄可在網頁控制檯的歷史記錄部分檢視。你可以:

  • 按說話人篩選閱讀;
  • 全部或部分複製;
  • 作為分析和思維導圖的基礎資料使用。

常見錯誤

錯誤 原因 解決方法
對方聲音未被轉錄 未授予螢幕錄製權限(macOS)或系統音訊不可用(Windows) macOS 權限 / Windows
轉錄中語言錯誤 選擇了錯誤的轉錄語言 在設定中更改語言並重啟會話
文字在說話人之間混淆 麥克風同時捕獲了兩路音訊(回聲) 使用耳機或降低揚聲器音量
網路較差時沒有文字 WebSocket 在 Whisper 返回結果前斷開 改善網路連線;Whisperer 會自動重連

最佳實踐

  • 使用耳機 — 可消除回聲,改善說話人分離效果。
  • 在會話前選擇正確的語言 — 錄製中途更改語言會建立新會話。
  • 雙語通話時,可以選擇對方的語言:Whisper 依然能借助上下文提示識別你的語音。

相關文章