Etichette del parlante e diarizzazione

Come funziona il rilevamento dei parlanti e cosa influenza la precisione.

Local Transcriber utilizza la diarizzazione dei parlanti on-device per etichettare chi ha detto cosa nelle tue trascrizioni. Nessuna elaborazione nel cloud — il modello viene eseguito interamente sul tuo Mac.

Come funziona

Durante una registrazione, l’app cattura l’audio ed esegue due modelli:

  1. Riconoscimento vocale — converte l’audio in testo in tempo reale utilizzando il motore di riconoscimento vocale integrato di Apple.
  2. Diarizzazione dei parlanti — analizza le caratteristiche vocali per assegnare etichette del parlante (Parlante 1, Parlante 2, ecc.).

La trascrizione in diretta mostra il testo man mano che viene pronunciato. Dopo l’interruzione della registrazione, il post-processing rianalizza l’audio completo per un’attribuzione dei parlanti piu precisa e un testo migliorato.

Cosa influenza la precisione

La diarizzazione dei parlanti funziona meglio quando:

  • I parlanti si alternano. Il modello ha difficolta con le conversazioni sovrapposte o con piu persone che parlano contemporaneamente.
  • La qualita audio e buona. Una stanza silenziosa con un microfono adeguato e l’ideale. I microfoni integrati dei portatili funzionano, ma microfoni esterni o cuffie con microfono sono migliori.
  • I parlanti hanno voci distinte. Il modello utilizza le caratteristiche vocali (altezza, cadenza, timbro) per distinguere i parlanti. Voci molto simili possono essere raggruppate.
  • Le sessioni non sono estremamente lunghe. La precisione rimane costante per la maggior parte delle durate di riunione, ma registrazioni molto lunghe (oltre 3 ore) possono subire una certa deriva.

Consigli per risultati migliori

  • Usa auricolari o cuffie con microfono. Questo impedisce all’audio degli altoparlanti di entrare nel microfono, aiutando il modello di diarizzazione a separare le voci in modo piu pulito.
  • Disattiva il microfono quando non parli. Se ti trovi in un ambiente rumoroso, disattivare il microfono tra un intervento e l’altro riduce il rumore di fondo nella registrazione.
  • Lascia finire di parlare. La sovrapposizione di voci e il caso piu difficile per la diarizzazione. I turni di parola naturali producono i risultati migliori.

Post-processing

Quando interrompi una registrazione, l’app esegue automaticamente il post-processing. Questo richiede pochi secondi (circa 15 secondi per una riunione di 30 minuti) e:

  • Riesegue l’audio completo attraverso un modello di trascrizione di maggiore precisione.
  • Rianalizza le attribuzioni dei parlanti sull’intero registrazione per garantire la coerenza.
  • Genera un titolo e un riepilogo tramite IA (se Apple Intelligence e disponibile).

Vedrai un indicatore “Elaborazione in corso” nella barra laterale durante l’esecuzione. La trascrizione si aggiorna automaticamente una volta completato.

Rielaborazione

Se le etichette del parlante non sembrano corrette, puoi rielaborare una registrazione:

  • Dall’app — fai clic destro su una registrazione e seleziona Rielabora, oppure usa lo schema URL:
    open "transcriber://reprocess?file=2026-04-03-1400"
  • Dal CLI — il tuo agente IA puo anche attivare la rielaborazione.

La rielaborazione riesegue l’intero pipeline di post-processing sul file audio originale.

Provalo tu stesso.

Scarica Local Transcriber, partecipa a una chiamata e guarda la trascrizione apparire in tempo reale. Nessun account necessario.

Scarica

14 giorni di prova gratuita · $20 pagamento unico · macOS Sonoma 14.2+ · Apple Silicon nativo