Speaker Diarization en cada transcripción – no solo en el plan más caro
Respuesta automática a la pregunta «¿Quién dijo qué?» – para reuniones, entrevistas, pódcasts y grupos focales.
3 transcripciones gratis · sin tarjeta de crédito · datos en Alemania
Sprecher-Timeline
Me alegra que la cita haya salido bien.
Con gusto. ¿Empezamos ya mismo?
Sí – voy a grabar la conversación, ¿le parece bien?
La Speaker Diarization es la identificación automática de quién habla en cada momento. En DeepScript está incluida en ambos planes – Standard y Premium por igual. Muchos competidores la reservan para un plan Enterprise o la cobran aparte. Creemos que es un error: una transcripción sin atribución de hablantes es casi inútil para reuniones y entrevistas. Premium ofrece una granularidad más fina – sobre todo con voces parecidas o cuando hay solapamientos. Standard maneja de forma fiable 2–6 hablantes, Premium escala sin problemas a 10+.
Pruebas
En qué nos basamos
Incluido en Standard y Premium
Sin trampa de sobrecoste, sin «solo en el plan Enterprise». La diarización funciona en cada transcripción.
Granularidad a nivel de palabra
Cada palabra lleva una etiqueta de hablante – no solo frases enteras. Se detectan los cambios de hablante a mitad de frase.
Normalmente de 2 a 10+ hablantes
Incluso los grupos grandes – consejos de administración, paneles, grupos focales – se separan de forma fiable.
Renombrable en el editor
«Hablante 1» → «Dr. Meier» con un solo clic. El cambio de nombre se aplica a todas las apariciones.
En la práctica
Qué significa esto en concreto
Respuesta automática a la pregunta «¿Quién dijo qué?» – para reuniones, entrevistas, pódcasts y grupos focales.
- Marcas de tiempo a nivel de palabra con etiqueta de hablante en la exportación JSON – usables directamente en NVivo, MAXQDA y otras herramientas de análisis cualitativo.
- Subtítulos SRT/VTT con prefijo de hablante: cada subtítulo empieza con el nombre del hablante, p. ej. «Dr. Meier: …»
- Sincronizado con el reproductor de audio en el editor – haz clic en una palabra para saltar a su posición de audio y oír la voz original.
- Los hablantes anónimos siguen siendo anónimos: no tienes que asignar ningún nombre, «Hablante 1/2/3» es un estado final válido.
- El modelo Premium es mejor con el habla solapada (cross-talk) y las voces parecidas (p. ej. dos mujeres jóvenes).
Sprecher-Timeline
Me alegra que la cita haya salido bien.
Con gusto. ¿Empezamos ya mismo?
Sí – voy a grabar la conversación, ¿le parece bien?
Cómo usarlo
Listo en unos pocos pasos
- 1
1. Sube audio con varios hablantes
Grabación de reunión, entrevista, pódcast – cualquier formato con varios hablantes. Mono o estéreo, el modelo detecta por sí mismo los cambios de hablante.
- 2
2. Recibe la transcripción con etiquetas de hablante
El resultado en el editor muestra cada intervención con un prefijo de hablante: «Hablante 1: Buenos días. Hablante 2: Hola a todos.» El número de hablantes está en el encabezado.
- 3
3. Renombra los hablantes
Haz clic en «Hablante 1» → nombre real. Se aplica automáticamente a todas las apariciones en la transcripción. No se necesitan modelos de voz separados.
- 4
4. Exporta con etiquetas de hablante
SRT/VTT para subtítulos, JSON para pipelines posteriores, TXT para una versión de lectura limpia. La información de hablantes se conserva en todos los formatos.
FAQ
Preguntas frecuentes
¿Cuántos hablantes puede distinguir el modelo?+
Normalmente de 2 a 10+. Con más de 10 voces muy parecidas (p. ej. una clase escolar) pueden producirse confusiones. Para consejos de administración, paneles y grupos focales el límite no es un problema en la práctica.
¿Qué ocurre con el habla solapada?+
En el cross-talk el modelo atribuye la voz dominante y marca el fragmento con una puntuación de confianza baja. Premium es aquí notablemente mejor que Standard. En el editor, los pasajes afectados se reconocen por el coloreado por confianza.
¿Tengo que entrenar a los hablantes de antemano?+
No. La diarización funciona sin enrolamiento de voz – el modelo separa a los hablantes únicamente a partir de las características del audio, no de perfiles de voz preregistrados. Ventaja de privacidad: no se almacena ningún modelo de voz biométrico.
¿Aparecen también las etiquetas de hablante en los archivos de subtítulos?+
Sí. Las exportaciones SRT y VTT anteponen el nombre del hablante a cada subtítulo: «Dr. Meier: Empecemos.» Si has renombrado a los hablantes, aparecen los nombres reales; si no, «Hablante 1/2/3».
¿Es adecuado para investigación cualitativa con NVivo o MAXQDA?+
Sí. La exportación JSON incluye `start`, `end`, `confidence` y `speaker` por palabra. Impórtala en NVivo/MAXQDA mediante su flujo JSON o de texto plano con marcadores de hablante. Si necesitas un formato de exportación específico, dínoslo.
Compruébalo tú mismo
Sube un archivo y ve el resultado en minutos. Tres transcripciones gratis, sin tarjeta de crédito.