DeepScript
Vraag

Wat is Custom Vocabulary en wanneer heb ik het nodig?

Kort antwoord

Een woordenlijst die je het model vóór de transcriptie meegeeft met jargon en eigennamen – die tilt de herkenning van die termen vaak van 30% naar 95%.

Voor- en achternamen van collega's, productnamen, acroniemen, medisch en juridisch jargon – die woorden zijn voor een standaard-taalmodel onbekend of met de verkeerde spelling opgeslagen. Het model valt dan terug op fonetisch vergelijkbare gokjes. „Müller-Lüdenscheidt\" wordt „Mueller Loot Mitt\", „pembrolizumab\" wordt „Pemberlitsu Map\".

Custom Vocabulary (soms: „hot words\", „word boosting\", „uitspraakwoordenboek\") lost dat op. Vóór de transcriptie upload je een lijst met woorden die in jouw context belangrijk zijn. Het model weegt die woorden zwaarder bij de herkenning.

Wanneer je het nodig hebt - Je werkt in een vakgebied met gespecialiseerd vocabulaire (medisch, juridisch, farma, IT, productie). - Je transcribeert interviews met terugkerende personen (klanten, onderzoekspartners). - Je bedrijf heeft productnamen die niet in het algemene lexicon staan. - Je werkt met merken of bedrijven met een ongebruikelijke spelling.

Wanneer je het niet nodig hebt - Algemene gesprekken zonder vakjargon. - Korte fragmenten met gangbare woorden.

Hoe je een goede lijst opbouwt 1. Verzamel 20-50 termen per domein – meer, en het model „leert\" te veel en gaat andere fouten maken. 2. Schrijf ze in hun definitieve spelling (juiste diakritische tekens, koppeltekens, hoofdletters). 3. Geef bij zeer zeldzame woorden een fonetische hint als de aanbieder dat ondersteunt (bijv. „GDPR | DSGVO\"). 4. Werk de lijst bij naarmate er nieuwe termen opduiken.

Met DeepScript Bij het uploaden kun je een opgeslagen Vocabulary kiezen of een inline, door komma's gescheiden lijst plakken. Via de API: gebruik `vocabularyId` (opgeslagen lijst) of `vocabulary` (inline array) in het POST /v1/transcriptions-verzoek. Voor bestaande klanten loont het om eenmalig een centraal glossarium in de UI aan te maken en dat voor alle jobs te hergebruiken.

Reëel effect In onze interne benchmarks tilt een goed afgestemde Custom Vocabulary de herkenning van domeintermen van ongeveer 30% naar ongeveer 95%. Bij medische transcriptie is dat vaak de doorslaggevende factor tussen onbruikbaar en productieklaar.

Gerelateerde vragen

Nog een vraag?

Drie transcripties gratis om uit te proberen. Of stuur ons een mailtje – we reageren binnen 24 uur, ook op compliancevragen.

Custom Vocabulary in transcriptie – wanneer en waarvoor? | DeepScript