DeepScript
Prodotto

Speaker Diarization in ogni trascrizione – non solo nel piano più costoso

Risposta automatica alla domanda «Chi ha detto cosa?» – per riunioni, interviste, podcast e focus group.

3 trascrizioni gratuite · senza carta di credito · dati in Germania

app.deepscript.com/transcriptions

Sprecher-Timeline

Interlocutore 1
Interlocutore 2
Interlocutore 3
riunione-iniziale.mp3
Premium
Interlocutore 100:04

Mi fa piacere che l'appuntamento sia andato bene.

Interlocutore 200:09

Con piacere. Iniziamo subito?

Interlocutore 100:13

registro la conversazione, va bene?

12:48

La Speaker Diarization è l'identificazione automatica di chi sta parlando in ogni momento. In DeepScript è inclusa in entrambi i piani – Standard come Premium. Molti concorrenti la riservano a un piano Enterprise o la fatturano a parte. Riteniamo che sia un errore: una trascrizione senza attribuzione dei parlanti è quasi inutile per riunioni e interviste. Premium offre una granularità più fine – soprattutto per voci simili o in caso di sovrapposizione. Standard gestisce in modo affidabile 2–6 parlanti, Premium arriva senza problemi a 10+.

Prove

Su cosa lo basiamo

Incluso in Standard e Premium

Nessuna trappola di sovrapprezzo, nessun «solo nel piano Enterprise». La diarizzazione è attiva in ogni trascrizione.

Granularità a livello di parola

Ogni singola parola porta un'etichetta di parlante – non solo frasi intere. I cambi di parlante a metà frase vengono rilevati.

Tipicamente da 2 a 10+ parlanti

Anche i gruppi numerosi – consigli di amministrazione, panel, focus group – vengono separati in modo affidabile.

Rinominabile nell'editor

«Parlante 1» → «Dr. Meier» con un clic. La rinomina viene applicata a tutte le occorrenze.

In pratica

Cosa significa in concreto

Risposta automatica alla domanda «Chi ha detto cosa?» – per riunioni, interviste, podcast e focus group.

  • Timestamp a livello di parola con etichetta di parlante nell'export JSON – utilizzabili direttamente in NVivo, MAXQDA e altri strumenti di analisi qualitativa.
  • Sottotitoli SRT/VTT con prefisso del parlante: ogni sottotitolo inizia con il nome del parlante, ad es. «Dr. Meier: …»
  • Sincronizzato con il lettore audio nell'editor – clicca su una parola per raggiungere la posizione audio e ascoltare la voce originale.
  • I parlanti anonimi restano anonimi: non devi assegnare alcun nome, «Parlante 1/2/3» è uno stato finale valido.
  • Il modello Premium è migliore con il parlato sovrapposto (cross-talk) e con voci simili (ad es. due giovani donne).
app.deepscript.com/transcriptions

Sprecher-Timeline

Interlocutore 1
Interlocutore 2
Interlocutore 3
riunione-iniziale.mp3
Premium
Interlocutore 100:04

Mi fa piacere che l'appuntamento sia andato bene.

Interlocutore 200:09

Con piacere. Iniziamo subito?

Interlocutore 100:13

registro la conversazione, va bene?

12:48

Come si usa

Operativo in pochi passaggi

  1. 1

    1. Carica audio multi-parlante

    Registrazione di riunione, intervista, podcast – qualsiasi formato con più parlanti. Mono o stereo, il modello rileva da solo i cambi di parlante.

  2. 2

    2. Ottieni la trascrizione con etichette di parlante

    Il risultato nell'editor mostra ogni intervento con un prefisso di parlante: «Parlante 1: Buongiorno. Parlante 2: Ciao a tutti.» Il numero di parlanti è nell'intestazione.

  3. 3

    3. Rinomina i parlanti

    Clicca su «Parlante 1» → nome reale. Viene applicato automaticamente a tutti i punti della trascrizione. Non servono modelli vocali separati.

  4. 4

    4. Esporta con le etichette di parlante

    SRT/VTT per i sottotitoli, JSON per le pipeline a valle, TXT per una versione di sola lettura. L'informazione sui parlanti è conservata in ogni formato.

FAQ

Domande frequenti

Quanti parlanti può distinguere il modello?+

Tipicamente da 2 a 10+. Oltre le 10 voci molto simili (ad es. una classe scolastica) possono verificarsi confusioni. Per consigli di amministrazione, panel e focus group il limite non è un problema nella pratica.

Cosa succede con il parlato sovrapposto?+

In caso di cross-talk il modello attribuisce la voce dominante e segnala il punto con un punteggio di confidenza basso. Premium è qui nettamente migliore di Standard. Nell'editor i passaggi interessati si riconoscono dalla colorazione per confidenza.

Devo addestrare i parlanti in anticipo?+

No. La diarizzazione funziona senza enrollment vocale – il modello separa i parlanti unicamente dalle caratteristiche audio, non da profili vocali pre-registrati. Vantaggio per la privacy: non viene memorizzato alcun modello vocale biometrico.

Le etichette di parlante compaiono anche nei file di sottotitoli?+

Sì. Gli export SRT e VTT inseriscono il nome del parlante prima di ogni sottotitolo: «Dr. Meier: Iniziamo.» Se hai rinominato i parlanti, compaiono i nomi reali; altrimenti «Parlante 1/2/3».

È adatto alla ricerca qualitativa con NVivo o MAXQDA?+

Sì. L'export JSON contiene `start`, `end`, `confidence` e `speaker` per ogni parola. Importa in NVivo/MAXQDA tramite il loro flusso JSON o testo semplice con marcatori di parlante. Se ti serve un formato di export specifico, faccelo sapere.

Convinciti di persona

Carica un file e vedi il risultato in pochi minuti. Tre trascrizioni gratuite, senza carta di credito.

Speaker Diarization – Chi ha detto cosa | DeepScript | DeepScript