Speaker Diarization w każdej transkrypcji – nie tylko w najdroższym planie
Automatyczna odpowiedź na pytanie „Kto co powiedział?” – dla spotkań, wywiadów, podcastów i grup fokusowych.
3 darmowe transkrypcje · bez karty kredytowej · dane w Niemczech
Sprecher-Timeline
Cieszę się, że spotkanie doszło do skutku.
Bardzo chętnie. Zaczynamy od razu?
Tak – nagrywam rozmowę, czy to w porządku?
Speaker Diarization to automatyczne rozpoznawanie, kto mówi w danym momencie. W DeepScript jest zawarta w obu planach – Standard i Premium. Wielu konkurentów udostępnia ją dopiero w planie Enterprise lub nalicza osobno. Uważamy to za błąd: transkrypcja bez przypisania mówców jest przy spotkaniach i wywiadach niemal bezwartościowa. Premium oferuje dokładniejszą granularność – zwłaszcza przy podobnych głosach lub gdy mowa się nakłada. Standard niezawodnie obsługuje 2–6 mówców, Premium bez trudu skaluje się do 10+.
Dowody
Na czym to opieramy
Zawarte w Standard i Premium
Żadnej pułapki dopłat, żadnego „tylko w planie Enterprise”. Diaryzacja działa w każdej transkrypcji.
Granularność na poziomie słów
Każde pojedyncze słowo ma etykietę mówcy – nie tylko całe zdania. Zmiany mówcy w środku zdania są wykrywane.
Zwykle od 2 do 10+ mówców
Nawet duże grono – posiedzenia zarządu, panele, grupy fokusowe – jest niezawodnie rozdzielane.
Możliwość zmiany nazwy w edytorze
„Mówca 1” → „Dr Meier” jednym kliknięciem. Zmiana nazwy obejmuje wszystkie wystąpienia.
W praktyce
Co to oznacza w praktyce
Automatyczna odpowiedź na pytanie „Kto co powiedział?” – dla spotkań, wywiadów, podcastów i grup fokusowych.
- Znaczniki czasu na poziomie słów z etykietą mówcy w eksporcie JSON – bezpośrednio użyteczne w NVivo, MAXQDA i innych narzędziach analizy jakościowej.
- Napisy SRT/VTT z prefiksem mówcy: każdy napis zaczyna się od nazwy mówcy, np. „Dr Meier: …”
- W edytorze zsynchronizowane z odtwarzaczem audio – kliknij słowo, aby przejść do jego pozycji w nagraniu i usłyszeć oryginalny głos.
- Anonimowi mówcy pozostają anonimowi: nie musisz nadawać żadnej nazwy, „Mówca 1/2/3” to prawidłowy stan końcowy.
- Model Premium lepiej radzi sobie z nakładającą się mową (cross-talk) i podobnie brzmiącymi głosami (np. dwie młode kobiety).
Sprecher-Timeline
Cieszę się, że spotkanie doszło do skutku.
Bardzo chętnie. Zaczynamy od razu?
Tak – nagrywam rozmowę, czy to w porządku?
Jak z tego korzystać
Gotowe w kilku krokach
- 1
1. Prześlij nagranie z wieloma mówcami
Nagranie spotkania, wywiad, podcast – każdy format z wieloma mówcami. Mono lub stereo, model sam wykrywa, kiedy ktoś się zmienia.
- 2
2. Otrzymaj transkrypcję z etykietami mówców
Wynik w edytorze pokazuje każdą wypowiedź z prefiksem mówcy: „Mówca 1: Dzień dobry. Mówca 2: Cześć wszystkim.” Liczba mówców jest w nagłówku.
- 3
3. Zmień nazwy mówców
Kliknij „Mówca 1” → prawdziwa nazwa. Stosowana automatycznie do wszystkich miejsc w transkrypcji. Nie są potrzebne osobne modele głosu.
- 4
4. Wyeksportuj z etykietami mówców
SRT/VTT do napisów, JSON do dalszych pipeline'ów, TXT do czystej wersji do czytania. Informacja o mówcach jest zachowana w każdym formacie.
FAQ
Często zadawane pytania
Ilu mówców model potrafi rozróżnić?+
Zwykle od 2 do 10+. Przy ponad 10 bardzo podobnych głosach (np. klasa szkolna) może dojść do pomyłek. Dla posiedzeń zarządu, paneli i grup fokusowych ten limit w praktyce nie stanowi problemu.
Co dzieje się przy nakładającej się mowie?+
Przy cross-talku model przypisuje dominujący głos i oznacza fragment niską oceną pewności. Premium jest tu zauważalnie lepszy niż Standard. W edytorze rozpoznasz takie fragmenty po kolorowaniu według pewności.
Czy muszę wcześniej trenować mówców?+
Nie. Diaryzacja działa bez rejestracji głosu – model rozdziela mówców wyłącznie na podstawie cech audio, a nie wcześniej zapisanych profili głosowych. Korzyść dla prywatności: nie są przechowywane żadne biometryczne modele głosu.
Czy etykiety mówców pojawiają się także w plikach napisów?+
Tak. Eksporty SRT i VTT umieszczają przed każdym napisem nazwę mówcy: „Dr Meier: Zaczynajmy.” Jeśli zmieniłeś nazwy mówców, pojawiają się prawdziwe nazwiska; w przeciwnym razie „Mówca 1/2/3”.
Czy nadaje się do badań jakościowych w NVivo lub MAXQDA?+
Tak. Eksport JSON zawiera dla każdego słowa `start`, `end`, `confidence` i `speaker`. Zaimportuj do NVivo/MAXQDA poprzez ich przepływ JSON lub zwykłego tekstu ze znacznikami mówców. Jeśli potrzebujesz konkretnego formatu eksportu, daj nam znać.
Przekonaj się sam
Prześlij plik i zobacz wynik w kilka minut. Trzy darmowe transkrypcje, bez karty kredytowej.