Najdokładniejsza transkrypcja niemieckojęzycznych dialektów
Specjalizujemy się w jednej rzeczy: nagraniach z regionu DACH. Szwajcarski niemiecki, bawarski, wiedeński, dolnoniemiecki – tam, gdzie modele ogólne zgadują, my słuchamy uważnie.
3 darmowe transkrypcje · bez karty kredytowej · dane w Niemczech
Cieszę się, że spotkanie doszło do skutku.
Bardzo chętnie. Zaczynamy od razu?
Tak – nagrywam rozmowę, czy to w porządku?
Większość usług transkrypcji korzysta z ogólnego modelu wielojęzycznego, który traktuje wszystkie 99 języków mniej więcej tak samo. Dla czystego standardowego niemieckiego to wystarcza. Ale gdy tylko berneński klient mamrocze, wiedenka mówi błyskawicznie albo bawarskie spotkanie przechodzi w dialekt, dokładność się załamuje. DeepScript poszedł inną drogą: nasz model Premium jest dostrojony na ponad 50 000 godzin nagrań DACH – prawdziwych spotkań biznesowych, wywiadów i podcastów. Ten zbiór danych pochodzi z dziedzictwa Aliru GmbH, które przed DeepScript prowadziło Sally (sally.io), asystenta spotkań opartego na AI. Efekt: Word Error Rate na poziomie ~3–5% dla czystego niemieckiego, wobec 7–9% dla ogólnego Whisper-large.
Dowody
Na czym to opieramy
Ponad 50 000 godzin nagrań DACH w treningu
Prawdziwe spotkania, wywiady i rozmowy telefoniczne z Niemiec, Austrii i Szwajcarii – żadnego syntetycznego dźwięku.
~3–5% WER dla czystego niemieckiego (Premium)
Mierzone na wyselekcjonowanym zestawie testowym standardowego niemieckiego. Ogólny Whisper-large osiąga 7–9% na tym samym zestawie.
Dziedzictwo: Sally (sally.io)
Aliru GmbH od lat tworzy AI do spotkań dla firm z regionu DACH. To doświadczenie trafiło wprost do modelu DeepScript.
Certyfikat ISO 27001 / 9001 / 14001
Bezpieczeństwo informacji, zarządzanie jakością i zarządzanie środowiskowe – trzy certyfikaty, jedna firma.
Serwery w Norymberdze i Falkenstein
Własny sprzęt Hetzner w niemieckich centrach danych. Żadnego amerykańskiego podwykonawcy chmurowego na ścieżce transkrypcji.
W praktyce
Co to oznacza w praktyce
Specjalizujemy się w jednej rzeczy: nagraniach z regionu DACH. Szwajcarski niemiecki, bawarski, wiedeński, dolnoniemiecki – tam, gdzie modele ogólne zgadują, my słuchamy uważnie.
- Rozpoznawanie dialektów: szwajcarski niemiecki, bawarski, wiedeński, dolnoniemiecki i saksoński – tam, gdzie modele ogólne zsuwają się w angielski, my pozostajemy w kontekście.
- Speaker Diarization w obu planach. Standard niezawodnie obsługuje 2–6 mówców, Premium rozdziela także podobnie brzmiące głosy.
- Custom Vocabulary dla nazw własnych, żargonu i firmowych akronimów – wymiernie poprawia rozpoznawanie terminów takich jak „Schwarz-Schilling” czy „MRI ważone T1”.
- 99 języków (automatyczne wykrywanie lub ręczny wybór), z priorytetem dla języków DACH pod względem dokładności i opóźnień.
- Znaczniki czasu na poziomie słów z oceną pewności dla każdego słowa – widoczne w edytorze i eksportowalne jako JSON do dalszych pipeline'ów.
Jak z tego korzystać
Gotowe w kilku krokach
- 1
1. Wybierz model
Standard (0,18 €/godz.) do czystych nagrań i codziennych rozmów. Premium (0,27 €/godz.) do dialektu, hałasu, wielu mówców lub gdy transkrypcja musi nadawać się do cytowania.
- 2
2. Utwórz Custom Vocabulary (opcjonalnie)
Dodaj nazwy własne, nazwy produktów i terminy fachowe do listy. To samo Custom Vocabulary jest następnie stosowane do wszystkich transkrypcji w projekcie.
- 3
3. Prześlij lub nagraj na żywo
Przeciągnij plik audio lub wideo albo użyj transkrypcji na żywo przez mikrofon. Premium trafia do kolejki priorytetowej.
- 4
4. Sprawdź i wyeksportuj
W edytorze: zmień nazwy mówców, kliknij dowolne słowo, aby przejść do jego pozycji w audio, użyj kolorowania według pewności. Eksportuj jako TXT, SRT, VTT lub JSON.
FAQ
Często zadawane pytania
Czym DeepScript jest lepszy od ogólnego Whispera?+
Ogólny Whisper-large jest trenowany na szerokiej mieszance 99 języków – przeciętnie dobry, w żadnym wybitny. Bierzemy tę samą architekturę i kontynuujemy trening na ponad 50 000 godzin nagrań specyficznych dla DACH. Dla czystego niemieckiego daje to ~3–5% WER, podczas gdy ogólny Whisper-large osiąga 7–9% na tym samym zestawie. W przypadku dialektów różnica jest jeszcze większa.
Dlaczego skupienie na DACH?+
Przed DeepScript firma Aliru GmbH przez lata prowadziła Sally (sally.io), asystenta spotkań opartego na AI z klientelą głównie niemieckojęzyczną. Powstał z tego korpus treningowy i doświadczenie operacyjne, których ogólni dostawcy po prostu nie mają. Budujemy produkt, którego sami potrzebowaliśmy.
Czy dla angielskiego mam tę samą jakość?+
Angielski jest doskonale obsługiwany dzięki bazie Whisper – WER zwykle wynosi 4–6% dla czystych nagrań. Nasze dostrojenie nie poprawia go w wymierny sposób (angielski już dominował w oryginalnym treningu Whispera). Jesteśmy lepsi w DACH; w angielskim jesteśmy mniej więcej na równi z dużymi dostawcami.
Co konkretnie oznacza Speaker Diarization?+
Każde słowo otrzymuje, oprócz transkrypcji, etykietę mówcy („Mówca 1”, „Mówca 2” …). W edytorze możesz zmienić etykiety na prawdziwe nazwiska. W eksportach SRT/VTT pojawiają się jako prefiks przed każdym napisem; w JSON jako pole przy każdym słowie. W każdej chwili możesz samodzielnie poprawić dowolną etykietę.
Czym Premium różni się od Standard?+
Trzy rzeczy: (1) dostrojenie DACH działa tylko w modelu Premium – Standard korzysta z lżejszego wariantu; (2) Premium trafia do kolejki priorytetowej z krótszym czasem oczekiwania; (3) Speaker Diarization jest dokładniej dostrojona do podobnie brzmiących głosów. Standard kosztuje 0,18 €/godz., Premium 0,27 €/godz.
Przekonaj się sam
Prześlij plik i zobacz wynik w kilka minut. Trzy darmowe transkrypcje, bez karty kredytowej.