La transcripción más precisa para los dialectos de habla alemana
Nos especializamos en una sola cosa: el audio de la región DACH. Alemán suizo, bávaro, vienés, bajo alemán – donde los modelos genéricos adivinan, nosotros escuchamos con atención.
3 transcripciones gratis · sin tarjeta de crédito · datos en Alemania
Me alegra que la cita haya salido bien.
Con gusto. ¿Empezamos ya mismo?
Sí – voy a grabar la conversación, ¿le parece bien?
La mayoría de los servicios de transcripción usan un modelo multilingüe genérico que trata las 99 lenguas más o menos por igual. Para el alemán estándar claro es suficiente. Pero en cuanto un cliente bernés murmura, una vienesa habla a toda velocidad o una reunión bávara se desliza al dialecto, la precisión se desploma. DeepScript tomó el otro camino: nuestro modelo Premium está ajustado con más de 50.000 horas de audio DACH – reuniones de negocios reales, entrevistas y pódcasts. Ese conjunto de datos proviene de la herencia de Aliru GmbH, que antes de DeepScript operó Sally (sally.io), un asistente de reuniones con IA. El resultado: un Word Error Rate del ~3–5% en alemán claro, frente al 7–9% de Whisper-large genérico.
Pruebas
En qué nos basamos
Más de 50.000 horas de audio DACH en el entrenamiento
Reuniones, entrevistas y llamadas telefónicas reales de Alemania, Austria y Suiza – sin audio sintético.
~3–5% de WER en alemán claro (Premium)
Medido frente a un conjunto de prueba de alemán estándar curado. Whisper-large genérico obtiene un 7–9% en el mismo conjunto.
Herencia: Sally (sally.io)
Aliru GmbH lleva años creando IA de reuniones para empresas DACH. Esa experiencia pasó directamente al modelo de DeepScript.
Certificado ISO 27001 / 9001 / 14001
Seguridad de la información, gestión de la calidad y gestión ambiental – tres certificaciones, una sola empresa.
Servidores en Núremberg y Falkenstein
Nuestro propio hardware Hetzner en centros de datos alemanes. Ningún subencargado de nube estadounidense en la ruta de transcripción.
En la práctica
Qué significa esto en concreto
Nos especializamos en una sola cosa: el audio de la región DACH. Alemán suizo, bávaro, vienés, bajo alemán – donde los modelos genéricos adivinan, nosotros escuchamos con atención.
- Reconocimiento de dialectos para alemán suizo, bávaro, vienés, bajo alemán y sajón – donde los modelos genéricos se desvían al inglés, nosotros nos mantenemos en contexto.
- Speaker Diarization incluida en ambos planes. Standard maneja de forma fiable 2–6 hablantes, Premium también separa voces que suenan parecidas.
- Custom Vocabulary para nombres propios, jerga y acrónimos específicos de la empresa – mejora de forma medible el reconocimiento de términos como «Schwarz-Schilling» o «RM ponderada en T1».
- 99 idiomas disponibles (detección automática o selección manual), con los idiomas DACH priorizados en precisión y latencia.
- Marcas de tiempo a nivel de palabra con puntuación de confianza por palabra – visibles en el editor y exportables como JSON para tus pipelines posteriores.
Cómo usarlo
Listo en unos pocos pasos
- 1
1. Elige un modelo
Standard (0,18 €/h) para grabaciones limpias y conversaciones cotidianas. Premium (0,27 €/h) para dialecto, ruido, muchos hablantes o cuando la transcripción debe ser citable.
- 2
2. Crear un Custom Vocabulary (opcional)
Añade nombres propios, nombres de productos y términos técnicos a una lista. El mismo Custom Vocabulary se aplica luego a todas las transcripciones del proyecto.
- 3
3. Sube o graba en directo
Arrastra un archivo de audio o vídeo, o usa la transcripción en directo con el micrófono. Premium se procesa en la cola prioritaria.
- 4
4. Revisa y exporta
En el editor: renombra hablantes, haz clic en cualquier palabra para ir a su posición de audio, usa el coloreado por confianza. Exporta como TXT, SRT, VTT o JSON.
FAQ
Preguntas frecuentes
¿En qué es DeepScript mejor que Whisper genérico?+
Whisper-large genérico está entrenado con una amplia mezcla de 99 idiomas – correcto en general, excelente en ninguno. Tomamos la misma arquitectura y seguimos entrenando con más de 50.000 horas de audio específico de DACH. En alemán claro eso nos da ~3–5% de WER, mientras que Whisper-large genérico mide un 7–9% en el mismo conjunto. La diferencia se amplía notablemente en los dialectos.
¿Por qué centrarse en DACH?+
Antes de DeepScript, Aliru GmbH operó durante años Sally (sally.io), un asistente de reuniones con IA con una base de clientes mayoritariamente de habla alemana. Eso generó un corpus de entrenamiento y una experiencia operativa que los proveedores genéricos sencillamente no tienen. Construimos el producto que nosotros mismos necesitábamos.
¿Obtengo la misma calidad para el inglés?+
El inglés está excelentemente soportado a través de la base de Whisper – el WER suele situarse en torno al 4–6% en grabaciones limpias. Nuestro ajuste no lo mejora de forma medible (el inglés ya dominaba en el entrenamiento original de Whisper). Somos mejores en DACH; en inglés estamos más o menos a la par con los grandes proveedores.
¿Qué significa la Speaker Diarization en la práctica?+
A cada palabra se le asigna, además de la transcripción, una etiqueta de hablante («Hablante 1», «Hablante 2» …). En el editor puedes renombrar las etiquetas con nombres reales. En las exportaciones SRT/VTT aparecen como prefijo antes de cada subtítulo; en JSON como un campo en cada palabra. Puedes corregir cualquier etiqueta en cualquier momento.
¿En qué se diferencia Premium de Standard?+
Tres cosas: (1) el ajuste DACH solo está activo en el modelo Premium – Standard usa una variante más ligera; (2) Premium se procesa en una cola prioritaria con menores tiempos de espera; (3) la Speaker Diarization está más afinada para voces parecidas. Standard cuesta 0,18 €/hora, Premium 0,27 €/hora.
Compruébalo tú mismo
Sube un archivo y ve el resultado en minutos. Tres transcripciones gratis, sin tarjeta de crédito.