Wer 2026 eine Transkriptions-API auswählt, sieht auf den ersten Blick einen einfachen Markt: eine Handvoll Anbieter, vergleichbare Funktionslisten, Preise, die alle in derselben Größenordnung liegen. Den günstigsten nehmen, die Integration schreiben, weitermachen.
So funktioniert es nicht. Die "vergleichbaren" Anbieter verhalten sich im Betrieb sehr unterschiedlich: bei verrauschtem Material, unter Last, nach einem Verbindungsabbruch, bei Dialekt, und vor allem darin, wo das Audio während der Verarbeitung physisch liegt. Diese Unterschiede zeigen sich erst, wenn die Entscheidung schon getroffen ist.
Dieser Artikel vergleicht die vier Anbieter, die in echten Evaluationen am häufigsten auf dem Tisch liegen: OpenAI Whisper, AssemblyAI Universal-2, Google Speech-to-Text und DeepScript.
Die Kandidaten in Kurzform
OpenAI Whisper ist ein 2022 veröffentlichtes Open-Source-Sprachmodell, verfügbar in mehreren Größen von tiny bis large-v3. Sie können es selbst auf einer GPU betreiben oder über die OpenAI-API mieten, dort zu 0,006 US-Dollar pro Minute, also etwa 0,36 US-Dollar pro Stunde. 99 Sprachen, und für die meisten Entwickler der Bezugspunkt, an den sie zuerst denken.
AssemblyAI Universal-2 ist das Spitzenmodell von AssemblyAI, optimiert auf Englisch und die großen europäischen Sprachen. Der Preis für Batch-Transkription liegt bei rund 0,27 US-Dollar pro Stunde. Sprechertrennung, automatische Kapitel und PII-Redaktion sind Zusatzoptionen.
Google Speech-to-Text v2 bietet mehrere Modelle (Latest, Telephony, Medical) und sprachspezifische Varianten. Der Einstieg liegt bei 0,024 US-Dollar pro Minute, also etwa 1,44 US-Dollar pro Stunde, mit Abnahmezusagen sinkt es auf 0,012.
DeepScript ist ein DACH-fokussierter Anbieter auf eigener Infrastruktur in Deutschland. Zwei Stufen: Standard zu 0,18 € pro Stunde, Premium zu 0,27 € pro Stunde. Sprechertrennung und Custom Vocabulary sind in beiden enthalten, DSGVO-Konformität ist der Standardfall und keine Enterprise-Option.
Genauigkeit im Alltag
Vorab zur Einordnung: die folgenden Zahlen sind Erfahrungswerte aus Evaluationen mit Kundenmaterial, kein veröffentlichter Benchmark. Sie taugen zur Orientierung, nicht als Beleg, und die einzige Zahl, die für Ihre Entscheidung zählt, ist die auf Ihren eigenen Aufnahmen.
Sauberes Studio-Englisch (Interview, ein Sprecher, gutes Mikrofon): alle vier liegen innerhalb von ein bis zwei Prozentpunkten, die Wortfehlerrate um 3 bis 5 Prozent. In diesem Szenario ist der Unterschied nicht relevant.
Verrauschte Besprechung auf Englisch (Zoom, mehrere Sprecher, gelegentliches Durcheinander): Whisper-large und Universal-2 liefern etwa 8 bis 10 Prozent, Googles Latest-Modell liegt mit 11 bis 13 Prozent zurück, DeepScript Premium bei 7 bis 9 Prozent. Der Vorsprung kommt weniger vom Modell als davon, dass die Sprechertrennung Teil der Erkennung ist und nicht eine Nachbearbeitung.
Deutsch mit bayrischer oder österreichischer Färbung: hier beginnen die überwiegend englisch trainierten Modelle zu leiden. Whisper-large fällt bei moderat dialektalem Deutsch auf 18 bis 22 Prozent, Universal-2 landet bei 14 bis 17, Googles deutsches Modell hält 13 bis 15, DeepScript Premium mit DACH-Feinabstimmung 8 bis 11.
Bei Schweizerdeutsch ist der Abstand größer und die absoluten Zahlen sind für alle Anbieter schlechter. Dazu haben wir einen eigenen Artikel über Dialekte, weil das Thema mit der Anbieterwahl allein nicht gelöst ist.
Telefonqualität (8 kHz mono, Codec-Kompression): Google Telephony ist hier wirklich gut, etwa 12 bis 14 Prozent für Englisch, weil es dafür trainiert wurde. Whisper-large kämpft bei rund 20 Prozent. DeepScript liegt bei 14 bis 17 Prozent, brauchbar, aber für diesen Sonderfall nicht auf Google-Niveau.
Sehr kleine Sprachen (etwa Walisisch, Baskisch, Suaheli): Whisper hat eine überraschend breite Abdeckung und schlägt dort kommerzielle APIs, die für die Sprache nie trainiert wurden. Für solche Fälle sind Whisper oder DeepScript die naheliegende Wahl, da beide auf einem Whisper-Rückgrat aufsetzen.
Die Preise, ehrlich gerechnet
Listenpreise führen in die Irre. Was zählt, ist der effektive Stundenpreis mit den Funktionen, die Sie tatsächlich brauchen.
| Anbieter | Listenpreis | Sprechertrennung | Custom Vocabulary | effektiv pro Stunde |
|---|---|---|---|---|
| OpenAI Whisper API | 0,006 $/Min | nicht enthalten | nicht unterstützt | 0,36 $ (ca. 0,34 €) |
| AssemblyAI Universal-2 | 0,27 $/h | Zusatzoption | enthalten | 0,30 bis 0,45 $ |
| Google STT v2 | 0,024 $/Min | höhere Stufe | enthalten | 1,20 bis 1,50 $ |
| DeepScript Standard | 0,18 €/h | enthalten | enthalten | 0,18 € |
| DeepScript Premium | 0,27 €/h | enthalten | enthalten | 0,27 € |
Dazu drei Anmerkungen. Die Sprechertrennung bei AssemblyAI schlägt mit etwa 30 Prozent auf den Stundenpreis durch. Googles Preis hängt stark am Modell und daran, ob Sie Volumen vorab zusagen; die genannten Werte sind Pay-as-you-go. Bei DeepScript sind Sprechertrennung und Custom Vocabulary in beiden Stufen inklusive, Premium hebt die Engine für schwieriges Audio.
Für einen einmaligen Stapel ist die Whisper-API am günstigsten. Für einen Produktionsbetrieb mit Sprechertrennung ist DeepScript Standard die Untergrenze des Marktes.
Ein Punkt, der in deutschen Ausschreibungen regelmäßig übersehen wird: bei den US-Anbietern kostet die EU-Datenhaltung Aufpreis oder setzt einen Enterprise-Vertrag voraus. Der Vergleich lautet dann nicht 0,27 $ gegen 0,18 €, sondern Enterprise-Tarif gegen Standardtarif. Rechnen Sie den Vergleich mit den Optionen, die Sie wirklich brauchen, oder nutzen Sie den Preisrechner mit Ihrem echten Volumen.
Sprachabdeckung
| Anbieter | Sprachen | stark bei | schwach bei |
|---|---|---|---|
| Whisper-large | 99 | Englisch, Spanisch, Französisch | Telefonaudio, dialektales Deutsch |
| AssemblyAI Universal-2 | 11+ | Englisch, Spanisch, Französisch | alles außerhalb der Kernsprachen |
| Google STT v2 | 125+ | große Sprachen, Telefonie | kleinere europäische Varietäten |
| DeepScript | 99 | Deutsch, Französisch, Italienisch, Niederländisch, DACH-Dialekte | sehr kleine Sprachen außerhalb Europas |
Wenn Ihr Material überwiegend englisch oder in einer großen europäischen Sprache ist, sind alle vier vertretbar. Brauchen Sie breite Abdeckung bis in kleine Sprachen, kommen Whisper oder DeepScript in Frage. Liegt der Schwerpunkt im DACH-Raum oder gibt es Dialektanteile, führt DeepScript. Machen Sie Telefonie in großem Maßstab, hat Google für Telefonaudio weiter den Vorsprung.
Datenschutz und Verarbeitungsort
Hier trennen sich die Anbieter deutlich, und hier fallen die meisten Entscheidungen europäischer Kunden.
OpenAI Whisper API. Das Audio geht an die US-Infrastruktur von OpenAI. Die Datenschutzangaben besagen, dass API-Eingaben nicht standardmäßig zum Training verwendet werden und 30 Tage zur Missbrauchserkennung vorgehalten werden. Für DSGVO-gebundene Arbeitslasten braucht das Standardvertragsklauseln plus eine belastbare Übermittlungsfolgenabschätzung. Viele europäische Unternehmen haben sensible Inhalte deshalb abgezogen.
AssemblyAI. US-Anbieter, SOC 2 Type 2, HIPAA-fähiger Modus. Verarbeitung standardmäßig in den USA, EU-Datenhaltung nur in Enterprise-Tarifen und gegen Aufpreis.
Google Speech-to-Text. EU-Datenhaltung ist für bestimmte Modelle verfügbar, der tatsächliche Verarbeitungspfad kann je nach Modellvariante trotzdem über US-Infrastruktur laufen. Die Standardbedingungen deckeln die DSGVO-Pflichten, die Rechtsgrundlagenfrage bleibt das bekannte Schrems-II-Thema.
DeepScript. Server in Deutschland, bei Hetzner in Nürnberg und Falkenstein. Audio verlässt die EU nicht. Kein Training auf Kundendaten, vertraglich zugesagt. Der AVV ist auf der Website direkt unterzeichenbar, ohne Vertriebsgespräch. Voreingestellte Aufbewahrung 30 Tage, dauerhafte Speicherung über den Pro-Tarif zu 22 € im Monat.
Für regulierte Inhalte, also Medizin, Recht, Personal und öffentlicher Sektor, ist das häufig der entscheidende Punkt. Wie die Prüfung im Einzelnen aussieht, steht in unserem Artikel zu Transkription und DSGVO.
Entwicklererfahrung
Whisper API. Minimalistisch. Ein Endpunkt, Multipart-Upload, JSON oder VTT zurück. Kein Streaming, keine Sprechertrennung, keine Webhooks. Den Rest bauen Sie selbst. Wer eine kleine Abhängigkeit und volle Kontrolle will, ist damit gut bedient.
AssemblyAI. Ausgereifte SDKs für Python, JavaScript und Go, Webhooks bei Fertigstellung, asynchrones Job-Muster, gute Dokumentation. Der LeMUR-Endpunkt setzt LLM-Zusammenfassungen auf die Transkripte.
Google Speech-to-Text v2. Mächtig und komplex. Zwei API-Oberflächen (REST und gRPC), eine Recognizer-Abstraktion, regionsspezifische Endpunkte, Authentifizierung über Service-Account-Schlüssel mit der vollen IAM-Zeremonie. Sinnvoll, wenn das Team ohnehin in der Google Cloud arbeitet.
DeepScript. REST-API mit asynchronem Job-Muster, SSE-Stream für den Fortschritt, WebSocket für Live-Transkription, Webhooks, Custom Vocabulary als eigene Ressource. Die OpenAPI-3.1-Spezifikation liegt maschinenlesbar unter https://api.deepscript.com/openapi.json, die interaktive Dokumentation unter /docs. Ein MCP-Server für KI-Agenten ist im Pro-Tarif enthalten. Der Einstieg steht in der API-Übersicht.
Wann welcher Anbieter
Whisper API, wenn Sie den niedrigsten Minutenpreis für unkritische englische Inhalte brauchen, keine Sprechertrennung benötigen und keine DSGVO-Bindung haben. Oder wenn Sie das Modell selbst betreiben wollen; dazu haben wir eine eigene Kostenrechnung.
AssemblyAI, wenn Sie englischsprachig arbeiten, polierte SDKs schätzen und LLM-Funktionen wie Zusammenfassungen und Kapitel aus einer Hand und auf einer Rechnung wollen.
Google STT, wenn Sie tief in der Google Cloud stecken, Telefonie in großem Maßstab verarbeiten und die breiteste Sprachabdeckung brauchen.
DeepScript, wenn Sie ein europäisches Team sind, Ihr Material Deutsch, Französisch, Italienisch oder Niederländisch mit regionaler Färbung enthält, Sie DSGVO-konforme Verarbeitung ohne Enterprise-Aufpreis brauchen und Sprechertrennung sowie Custom Vocabulary enthalten sein sollen statt zugebucht.
Zur Rechnung Kosten gegen Genauigkeit
Der günstigste Anbieter ist selten der günstigste in der Summe. Ein Prozentpunkt weniger Wortfehlerrate spart bei einem 60-Minuten-Interview etwa vier Minuten Korrekturzeit. Zu einem Stundensatz von 40 € sind das 2,67 €, ein Vielfaches der Transkriptionskosten für dieselbe Stunde. Entscheiden Sie nach Genauigkeit auf Ihrem Material, nicht nach Preis pro Minute.
Der belastbare Weg dorthin: zehn repräsentative Aufnahmen aus dem echten Bestand nehmen, durch zwei oder drei Kandidaten schicken, Wortfehlerrate und Korrekturzeit messen. Kostenlose Kontingente gibt es bei allen. DeepScript gibt drei kostenlose Transkriptionen ohne Kreditkarte, AssemblyAI 50 US-Dollar Startguthaben, die Whisper-API rechnet ab dem ersten Aufruf nach Verbrauch.
Fazit
2022 war die realistische Wahl für produktive Transkription Google oder AWS zu über einem Dollar pro Stunde. 2026 gibt es ernsthafte Optionen unter 0,30 € pro Stunde, mit Sprechertrennung inklusive. Damit hat sich das Unterscheidungsmerkmal verschoben, vom Preis zur Passung: Sprachabdeckung, Dialekte, Verarbeitungsort und die Frage, wie sauber sich die API in den vorhandenen Stack einfügt.
Wenn Sie DeepScript gegen Ihr echtes Material testen wollen, geht das ohne Registrierung über das kostenlose Werkzeug; die ersten drei Transkriptionen kosten nichts.