內建功能 價格 常見問題 部落格 文件 登入

會議進行時就做逐字稿,不必等到結束

文字隨著說話往前走:你的聲音來自麥克風,對方的聲音來自系統音訊,兩條軌道分開,直到最後才合併,所以不會弄錯誰說了什麼。

辨識在說話時進行 · 錄好的檔案可在「會議」上傳

第一條軌道

你的麥克風,來源明確,不需要猜。

第二條軌道

系統音訊裡對方的聲音,無論用的是哪個應用。

結果

帶說話人和時間的文字,而且沒有人加入會議。

為什麼分兩條軌道

區分說話人是工程問題,不是猜測問題

只聽到一條混合音軌的工具必須猜:這句話是誰說的。Whisperer 不需要猜,因為兩條軌道在各自變成文字之前不會相遇。如果對方那邊有三個人,通話雙方之間的區分是確定的;而這三個人彼此之間的區分,仍然只是估計。

語言

開始之前設好會話語言

識別用的是 Whisper,支援 90 多種語言,中文在內。會話語言是通話之前選的設定;中英混說的會議選說得最多的那種,模型會處理其間的切換。

如果文字回來變成了拼音或英文字母,幾乎都是這個設定的問題,而不是識別本身出了錯。

效果好 國語,工作場景
  • 用職業語言進行的工作會議
  • 有準備的講述和彙報
  • 中文句子裡夾英文術語
  • 聲音乾淨、麥克風離得近
效果差 台語和快速口語
  • 台語、客語,以及大量中英夾雜的口語
  • 多人搶話、語速很快
  • 有回聲的大會議室
  • 會話語言沒設成中文

限制

必須講清楚的兩條

第一條限制 一次一份錄音,而不是整批遷移

已錄好的檔案是可以上傳的:「會議」區塊每次接受一個不超過 25 MB 的檔案——mp3、m4a、wav、ogg、flac、aac,以及 mp4 和 webm(取其音軌)。沒有的是整批上傳整個檔案庫;而且它消耗的分鐘數與實時通話相同。

第二條限制 台語比國語難

模型在國語上的訓練遠多於台語。雅婷逐字稿專門針對台灣口音、台語和中英夾雜做過最佳化,我們沒有;如果你的會議主要是台語,它更合適。

常見問題

大家最先問的

會有東西加入會議嗎?

不會。沒有機器人也沒有邀請。採集發生在你的電腦上,所以 Zoom、Google Meet、Teams、Webex、LINE 一視同仁。

需要什麼權限?

macOS 上需要螢幕錄製權限,它是採集系統音訊的前提;沒有它就只有你自己的聲音。Windows 上不需要額外權限。

可以匯出嗎?

可以:Markdown、SRT、VTT、JSON,而且不要求別人也用 Whisperer。

線下會議室呢?

用電腦麥克風可以,品質取決於距離和回聲。離說話人近一些差別很大。

用一次日常會議來試

把會話語言設成中文,會後讀一讀文字。一次就夠判斷。