DeepScript
Produkt

Speaker Diarization w każdej transkrypcji – nie tylko w najdroższym planie

Automatyczna odpowiedź na pytanie „Kto co powiedział?” – dla spotkań, wywiadów, podcastów i grup fokusowych.

3 darmowe transkrypcje · bez karty kredytowej · dane w Niemczech

app.deepscript.com/transcriptions

Sprecher-Timeline

Mówca 1
Mówca 2
Mówca 3
spotkanie-startowe.mp3
Premium
Mówca 100:04

Cieszę się, że spotkanie doszło do skutku.

Mówca 200:09

Bardzo chętnie. Zaczynamy od razu?

Mówca 100:13

Tak nagrywam rozmowę, czy to w porządku?

12:48

Speaker Diarization to automatyczne rozpoznawanie, kto mówi w danym momencie. W DeepScript jest zawarta w obu planach – Standard i Premium. Wielu konkurentów udostępnia ją dopiero w planie Enterprise lub nalicza osobno. Uważamy to za błąd: transkrypcja bez przypisania mówców jest przy spotkaniach i wywiadach niemal bezwartościowa. Premium oferuje dokładniejszą granularność – zwłaszcza przy podobnych głosach lub gdy mowa się nakłada. Standard niezawodnie obsługuje 2–6 mówców, Premium bez trudu skaluje się do 10+.

Dowody

Na czym to opieramy

Zawarte w Standard i Premium

Żadnej pułapki dopłat, żadnego „tylko w planie Enterprise”. Diaryzacja działa w każdej transkrypcji.

Granularność na poziomie słów

Każde pojedyncze słowo ma etykietę mówcy – nie tylko całe zdania. Zmiany mówcy w środku zdania są wykrywane.

Zwykle od 2 do 10+ mówców

Nawet duże grono – posiedzenia zarządu, panele, grupy fokusowe – jest niezawodnie rozdzielane.

Możliwość zmiany nazwy w edytorze

„Mówca 1” → „Dr Meier” jednym kliknięciem. Zmiana nazwy obejmuje wszystkie wystąpienia.

W praktyce

Co to oznacza w praktyce

Automatyczna odpowiedź na pytanie „Kto co powiedział?” – dla spotkań, wywiadów, podcastów i grup fokusowych.

  • Znaczniki czasu na poziomie słów z etykietą mówcy w eksporcie JSON – bezpośrednio użyteczne w NVivo, MAXQDA i innych narzędziach analizy jakościowej.
  • Napisy SRT/VTT z prefiksem mówcy: każdy napis zaczyna się od nazwy mówcy, np. „Dr Meier: …”
  • W edytorze zsynchronizowane z odtwarzaczem audio – kliknij słowo, aby przejść do jego pozycji w nagraniu i usłyszeć oryginalny głos.
  • Anonimowi mówcy pozostają anonimowi: nie musisz nadawać żadnej nazwy, „Mówca 1/2/3” to prawidłowy stan końcowy.
  • Model Premium lepiej radzi sobie z nakładającą się mową (cross-talk) i podobnie brzmiącymi głosami (np. dwie młode kobiety).
app.deepscript.com/transcriptions

Sprecher-Timeline

Mówca 1
Mówca 2
Mówca 3
spotkanie-startowe.mp3
Premium
Mówca 100:04

Cieszę się, że spotkanie doszło do skutku.

Mówca 200:09

Bardzo chętnie. Zaczynamy od razu?

Mówca 100:13

Tak nagrywam rozmowę, czy to w porządku?

12:48

Jak z tego korzystać

Gotowe w kilku krokach

  1. 1

    1. Prześlij nagranie z wieloma mówcami

    Nagranie spotkania, wywiad, podcast – każdy format z wieloma mówcami. Mono lub stereo, model sam wykrywa, kiedy ktoś się zmienia.

  2. 2

    2. Otrzymaj transkrypcję z etykietami mówców

    Wynik w edytorze pokazuje każdą wypowiedź z prefiksem mówcy: „Mówca 1: Dzień dobry. Mówca 2: Cześć wszystkim.” Liczba mówców jest w nagłówku.

  3. 3

    3. Zmień nazwy mówców

    Kliknij „Mówca 1” → prawdziwa nazwa. Stosowana automatycznie do wszystkich miejsc w transkrypcji. Nie są potrzebne osobne modele głosu.

  4. 4

    4. Wyeksportuj z etykietami mówców

    SRT/VTT do napisów, JSON do dalszych pipeline'ów, TXT do czystej wersji do czytania. Informacja o mówcach jest zachowana w każdym formacie.

FAQ

Często zadawane pytania

Ilu mówców model potrafi rozróżnić?+

Zwykle od 2 do 10+. Przy ponad 10 bardzo podobnych głosach (np. klasa szkolna) może dojść do pomyłek. Dla posiedzeń zarządu, paneli i grup fokusowych ten limit w praktyce nie stanowi problemu.

Co dzieje się przy nakładającej się mowie?+

Przy cross-talku model przypisuje dominujący głos i oznacza fragment niską oceną pewności. Premium jest tu zauważalnie lepszy niż Standard. W edytorze rozpoznasz takie fragmenty po kolorowaniu według pewności.

Czy muszę wcześniej trenować mówców?+

Nie. Diaryzacja działa bez rejestracji głosu – model rozdziela mówców wyłącznie na podstawie cech audio, a nie wcześniej zapisanych profili głosowych. Korzyść dla prywatności: nie są przechowywane żadne biometryczne modele głosu.

Czy etykiety mówców pojawiają się także w plikach napisów?+

Tak. Eksporty SRT i VTT umieszczają przed każdym napisem nazwę mówcy: „Dr Meier: Zaczynajmy.” Jeśli zmieniłeś nazwy mówców, pojawiają się prawdziwe nazwiska; w przeciwnym razie „Mówca 1/2/3”.

Czy nadaje się do badań jakościowych w NVivo lub MAXQDA?+

Tak. Eksport JSON zawiera dla każdego słowa `start`, `end`, `confidence` i `speaker`. Zaimportuj do NVivo/MAXQDA poprzez ich przepływ JSON lub zwykłego tekstu ze znacznikami mówców. Jeśli potrzebujesz konkretnego formatu eksportu, daj nam znać.

Przekonaj się sam

Prześlij plik i zobacz wynik w kilka minut. Trzy darmowe transkrypcje, bez karty kredytowej.

Speaker Diarization – Kto co powiedział | DeepScript | DeepScript