DeepScript
Produit

Speaker Diarization dans chaque transcription – pas seulement dans l'offre la plus chère

Réponse automatique à la question « Qui a dit quoi ? » – pour les réunions, interviews, podcasts et groupes de discussion.

3 transcriptions gratuites · sans carte bancaire · données en Allemagne

app.deepscript.com/transcriptions

Sprecher-Timeline

Locuteur 1
Locuteur 2
Locuteur 3
reunion-de-lancement.mp3
Premium
Locuteur 100:04

Ravi que le rendez-vous ait pu se faire.

Locuteur 200:09

Avec plaisir. On commence tout de suite?

Locuteur 100:13

Oui j'enregistre la conversation, ça vous va?

12:48

La Speaker Diarization est l'identification automatique de qui parle à chaque instant. Chez DeepScript, elle est incluse dans les deux offres – Standard comme Premium. De nombreux concurrents la réservent à une offre Enterprise ou la facturent en supplément. Nous pensons que c'est une erreur : une transcription sans attribution des locuteurs n'a quasiment aucune valeur pour les réunions et les interviews. Premium offre une granularité plus fine – surtout pour les voix qui se ressemblent ou en cas de chevauchement. Standard gère de manière fiable 2 à 6 locuteurs, Premium monte sans problème à 10+.

Preuves

Sur quoi nous nous appuyons

Inclus dans Standard et Premium

Aucun piège de surcoût, pas de « réservé à l'offre Enterprise ». La diarisation s'exécute dans chaque transcription.

Granularité au niveau du mot

Chaque mot porte une étiquette de locuteur – pas seulement des phrases entières. Les changements de locuteur en milieu de phrase sont détectés.

Typiquement 2 à 10+ locuteurs

Même les grandes réunions – conseils d'administration, panels, groupes de discussion – sont séparées de façon fiable.

Renommable dans l'éditeur

« Locuteur 1 » → « Dr Meier » en un clic. Le renommage s'applique à toutes les occurrences.

En pratique

Ce que cela signifie concrètement

Réponse automatique à la question « Qui a dit quoi ? » – pour les réunions, interviews, podcasts et groupes de discussion.

  • Horodatages au niveau du mot avec étiquette de locuteur dans l'export JSON – directement exploitables dans NVivo, MAXQDA et autres outils d'analyse qualitative.
  • Sous-titres SRT/VTT avec préfixe de locuteur : chaque sous-titre commence par le nom du locuteur, par ex. « Dr Meier : … »
  • Synchronisé avec le lecteur audio dans l'éditeur – cliquez sur un mot pour atteindre sa position audio et entendre la voix d'origine.
  • Les locuteurs anonymes le restent : vous n'avez aucun nom à attribuer, « Locuteur 1/2/3 » est un état final valable.
  • Le modèle Premium est meilleur sur les paroles qui se chevauchent (cross-talk) et les voix qui se ressemblent (par ex. deux jeunes femmes).
app.deepscript.com/transcriptions

Sprecher-Timeline

Locuteur 1
Locuteur 2
Locuteur 3
reunion-de-lancement.mp3
Premium
Locuteur 100:04

Ravi que le rendez-vous ait pu se faire.

Locuteur 200:09

Avec plaisir. On commence tout de suite?

Locuteur 100:13

Oui j'enregistre la conversation, ça vous va?

12:48

Comment l'utiliser

Opérationnel en quelques étapes

  1. 1

    1. Importer un audio multi-locuteurs

    Enregistrement de réunion, interview, podcast – tout format avec plusieurs locuteurs. Mono ou stéréo, le modèle détecte lui-même les changements de locuteur.

  2. 2

    2. Recevoir la transcription avec étiquettes de locuteur

    Le résultat dans l'éditeur affiche chaque prise de parole avec un préfixe de locuteur : « Locuteur 1 : Bonjour. Locuteur 2 : Salut à tous. » Le nombre de locuteurs figure dans l'en-tête.

  3. 3

    3. Renommer les locuteurs

    Cliquez sur « Locuteur 1 » → vrai nom. Appliqué automatiquement à tous les passages de la transcription. Aucun modèle de voix séparé nécessaire.

  4. 4

    4. Exporter avec les étiquettes de locuteur

    SRT/VTT pour les sous-titres, JSON pour les pipelines en aval, TXT pour une version de lecture pure. L'information sur les locuteurs est conservée dans tous les formats.

FAQ

Questions fréquentes

Combien de locuteurs le modèle peut-il distinguer ?+

Typiquement 2 à 10+. Au-delà de 10 voix très semblables (par ex. une classe d'école), des confusions peuvent survenir. Pour les conseils d'administration, panels et groupes de discussion, cette limite n'est pas un problème en pratique.

Que se passe-t-il en cas de paroles qui se chevauchent ?+

En cas de cross-talk, le modèle attribue la voix dominante et marque le passage avec un score de confiance faible. Premium est ici nettement meilleur que Standard. Dans l'éditeur, les passages concernés sont repérables grâce à la coloration par confiance.

Dois-je entraîner les locuteurs au préalable ?+

Non. La diarisation fonctionne sans enrôlement vocal – le modèle sépare les locuteurs uniquement à partir des caractéristiques audio, pas de profils vocaux pré-enregistrés. Avantage pour la confidentialité : aucun modèle vocal biométrique n'est stocké.

Les étiquettes de locuteur figurent-elles aussi dans les fichiers de sous-titres ?+

Oui. Les exports SRT et VTT inscrivent le nom du locuteur avant chaque sous-titre : « Dr Meier : C'est parti. » Si vous avez renommé les locuteurs, les vrais noms apparaissent ; sinon « Locuteur 1/2/3 ».

Est-ce adapté à la recherche qualitative avec NVivo ou MAXQDA ?+

Oui. L'export JSON contient `start`, `end`, `confidence` et `speaker` par mot. Importez dans NVivo/MAXQDA via leur flux JSON ou texte brut avec marqueurs de locuteur. Si vous avez besoin d'un format d'export spécifique, dites-le-nous.

Jugez-en par vous-même

Importez un fichier et voyez le résultat en quelques minutes. Trois transcriptions gratuites, sans carte bancaire.

Speaker Diarization – Qui a dit quoi | DeepScript | DeepScript