為什麼分兩條軌道
區分說話人是工程問題,不是猜測問題
只聽到一條混合音軌的工具必須猜:這句話是誰說的。Whisperer 不需要猜,因為兩條軌道在各自變成文字之前不會相遇。如果對方那邊有三個人,通話雙方之間的區分是確定的;而這三個人彼此之間的區分,仍然只是估計。
語言
開始之前設好會話語言
識別用的是 Whisper,支援 90 多種語言,中文在內。會話語言是通話之前選的設定;中英混說的會議選說得最多的那種,模型會處理其間的切換。
如果文字回來變成了拼音或英文字母,幾乎都是這個設定的問題,而不是識別本身出了錯。
效果好
國語,工作場景
- 用職業語言進行的工作會議
- 有準備的講述和彙報
- 中文句子裡夾英文術語
- 聲音乾淨、麥克風離得近
效果差
台語和快速口語
- 台語、客語,以及大量中英夾雜的口語
- 多人搶話、語速很快
- 有回聲的大會議室
- 會話語言沒設成中文
限制
必須講清楚的兩條
第一條限制
一次一份錄音,而不是整批遷移
已錄好的檔案是可以上傳的:「會議」區塊每次接受一個不超過 25 MB 的檔案——mp3、m4a、wav、ogg、flac、aac,以及 mp4 和 webm(取其音軌)。沒有的是整批上傳整個檔案庫;而且它消耗的分鐘數與實時通話相同。
第二條限制
台語比國語難
模型在國語上的訓練遠多於台語。雅婷逐字稿專門針對台灣口音、台語和中英夾雜做過最佳化,我們沒有;如果你的會議主要是台語,它更合適。
常見問題
大家最先問的
會有東西加入會議嗎?
不會。沒有機器人也沒有邀請。採集發生在你的電腦上,所以 Zoom、Google Meet、Teams、Webex、LINE 一視同仁。
需要什麼權限?
macOS 上需要螢幕錄製權限,它是採集系統音訊的前提;沒有它就只有你自己的聲音。Windows 上不需要額外權限。
可以匯出嗎?
可以:Markdown、SRT、VTT、JSON,而且不要求別人也用 Whisperer。
線下會議室呢?
用電腦麥克風可以,品質取決於距離和回聲。離說話人近一些差別很大。
用一次日常會議來試
把會話語言設成中文,會後讀一讀文字。一次就夠判斷。