Trascrizione delle riunioni mentre si parla, non dopo
Il testo avanza insieme alla conversazione: la tua voce dal microfono, quella dell'altra parte dall'audio di sistema, due tracce separate fino al momento del montaggio, così non si confonde chi ha detto cosa.
Il riconoscimento avviene mentre si parla · una registrazione pronta si carica in «Riunioni»
La tua voce dal microfono, con origine certa e senza congetture.
La voce dell'altra parte dall'audio di sistema, qualunque sia l'applicazione.
Testo con interlocutore e minuto, senza che nessuno entri in riunione.
Perché due tracce
Distinguere chi parla è ingegneria, non intuizione
Gli strumenti che sentono una sola traccia mescolata devono tirare a indovinare: questa voce di chi è. Whisperer non ne ha bisogno, perché le due tracce non si incontrano finché ciascuna non è diventata testo. Se dall'altra parte ci sono tre persone, la distinzione tra i due capi della chiamata resta garantita; quella fra le tre voci, invece, resta una stima.
La lingua
Imposta la lingua prima di iniziare, non dopo
Il riconoscimento gira su Whisper, che copre più di 90 lingue, italiano compreso. La lingua della sessione è un'impostazione che scegli prima della chiamata: in una riunione mista scegli quella che si parlerà di più, e il modello gestisce i passaggi intorno.
Se il testo torna nell'alfabeto sbagliato, il motivo è quasi sempre questo, non un difetto del riconoscimento.
- Riunioni con linguaggio professionale
- Interventi preparati e presentazioni
- Termini inglesi dentro una frase italiana
- Audio pulito e microfono vicino
- Più persone che si accavallano
- Dialetto stretto o forte inflessione locale
- Sale grandi con eco
- Lingua della sessione non impostata
Limiti
Due limiti da dire chiaramente
Una registrazione già pronta si può caricare: la sezione «Riunioni» accetta un file fino a 25 MB — mp3, m4a, wav, ogg, flac, aac, oltre a mp4 e webm, da cui viene presa la traccia audio. Quello che manca è il caricamento in blocco di un intero archivio; e consuma gli stessi minuti di una chiamata dal vivo.
Il modello è allenato molto più sull'italiano standard che sulle parlate locali. Una riunione in dialetto stretto esce sensibilmente peggio: vale la pena provare su una call sola prima di decidere.
Domande
Quello che si chiede per primo
Entra qualcosa nella riunione?
No. Nessun bot e nessun invito. La cattura avviene sul tuo computer, quindi Zoom, Google Meet, Teams e qualsiasi altra applicazione funzionano allo stesso modo.
Quali permessi servono?
Su macOS il permesso di registrazione dello schermo, che è ciò che consente di catturare l'audio di sistema; senza, nella trascrizione arriva solo la tua voce. Su Windows nessun permesso aggiuntivo.
Si può esportare?
Sì: Markdown, SRT, VTT e JSON, e non serve che qualcun altro usi Whisperer.
E una riunione in sala?
Funziona con il microfono del computer; la qualità dipende dalla distanza e dall'eco.
Mettilo alla prova su una riunione normale
Imposta l'italiano prima di entrare, poi leggi il testo a chiamata finita. Una sola basta per decidere.