Cosa c'è dentro Piani Domande Blog Documentazione Accedi

Trascrizione delle riunioni mentre si parla, non dopo

Il testo avanza insieme alla conversazione: la tua voce dal microfono, quella dell'altra parte dall'audio di sistema, due tracce separate fino al momento del montaggio, così non si confonde chi ha detto cosa.

Il riconoscimento avviene mentre si parla · una registrazione pronta si carica in «Riunioni»

Prima traccia

La tua voce dal microfono, con origine certa e senza congetture.

Seconda traccia

La voce dell'altra parte dall'audio di sistema, qualunque sia l'applicazione.

Risultato

Testo con interlocutore e minuto, senza che nessuno entri in riunione.

Perché due tracce

Distinguere chi parla è ingegneria, non intuizione

Gli strumenti che sentono una sola traccia mescolata devono tirare a indovinare: questa voce di chi è. Whisperer non ne ha bisogno, perché le due tracce non si incontrano finché ciascuna non è diventata testo. Se dall'altra parte ci sono tre persone, la distinzione tra i due capi della chiamata resta garantita; quella fra le tre voci, invece, resta una stima.

La lingua

Imposta la lingua prima di iniziare, non dopo

Il riconoscimento gira su Whisper, che copre più di 90 lingue, italiano compreso. La lingua della sessione è un'impostazione che scegli prima della chiamata: in una riunione mista scegli quella che si parlerà di più, e il modello gestisce i passaggi intorno.

Se il testo torna nell'alfabeto sbagliato, il motivo è quasi sempre questo, non un difetto del riconoscimento.

Viene bene Italiano di lavoro
  • Riunioni con linguaggio professionale
  • Interventi preparati e presentazioni
  • Termini inglesi dentro una frase italiana
  • Audio pulito e microfono vicino
Viene peggio Parlato veloce e sovrapposto
  • Più persone che si accavallano
  • Dialetto stretto o forte inflessione locale
  • Sale grandi con eco
  • Lingua della sessione non impostata

Limiti

Due limiti da dire chiaramente

Primo limite Una registrazione per volta, non una migrazione d'archivio

Una registrazione già pronta si può caricare: la sezione «Riunioni» accetta un file fino a 25 MB — mp3, m4a, wav, ogg, flac, aac, oltre a mp4 e webm, da cui viene presa la traccia audio. Quello che manca è il caricamento in blocco di un intero archivio; e consuma gli stessi minuti di una chiamata dal vivo.

Secondo limite Il dialetto stretto è più difficile

Il modello è allenato molto più sull'italiano standard che sulle parlate locali. Una riunione in dialetto stretto esce sensibilmente peggio: vale la pena provare su una call sola prima di decidere.

Domande

Quello che si chiede per primo

Entra qualcosa nella riunione?

No. Nessun bot e nessun invito. La cattura avviene sul tuo computer, quindi Zoom, Google Meet, Teams e qualsiasi altra applicazione funzionano allo stesso modo.

Quali permessi servono?

Su macOS il permesso di registrazione dello schermo, che è ciò che consente di catturare l'audio di sistema; senza, nella trascrizione arriva solo la tua voce. Su Windows nessun permesso aggiuntivo.

Si può esportare?

Sì: Markdown, SRT, VTT e JSON, e non serve che qualcun altro usi Whisperer.

E una riunione in sala?

Funziona con il microfono del computer; la qualità dipende dalla distanza e dall'eco.

Mettilo alla prova su una riunione normale

Imposta l'italiano prima di entrare, poi leggi il testo a chiamata finita. Una sola basta per decidere.