Worden mijn audiobestanden gebruikt om AI-modellen te trainen?
Kort antwoord
Bij sommige Amerikaanse aanbieders wel, tenzij je actief bezwaar maakt. Serieuze aanbieders sluiten het contractueel uit – vraag ernaar en lees de voorwaarden.
Het antwoord hangt volledig van de aanbieder af en bepaalt hoe veilig je gegevens werkelijk zijn. Drie typische modellen:
1. Standaardtraining op klantgegevens (opt-out). Sommige Amerikaanse cloudaanbieders gebruiken klantgegevens om hun modellen te trainen, tenzij je actief bezwaar maakt. OpenAI had dit aanvankelijk voor de ChatGPT-API ingeschakeld en later voor de API standaard uitgezet – bij andere aanbieders is het beeld wisselend. Speech-to-text-aanbieders gebruiken klantaudio vaak als „verbetersignaal\" voor hun akoestische en taalmodellen.
2. Opt-in voor training. Andere aanbieders trainen standaard niet op klantgegevens, maar lokken met kortingen („Schakel data delen in voor 30% korting\"). Dat is transparanter, maar gevaarlijk omdat een medewerker het vinkje onbedacht kan aanzetten.
3. Contractuele uitsluiting. Serieuze aanbieders sluiten gebruik voor training expliciet uit in hun standaardvoorwaarden en in de DPA. Art. 28 Abs. 3 lit. a AVG vereist sowieso dat de verwerker gegevens alleen verwerkt op gedocumenteerde instructie van de verwerkingsverantwoordelijke – training voor eigen doeleinden zou een schending zijn.
Waarom dit ertoe doet: als je audio in trainingsgegevens terechtkomt, kunnen zeldzame uitspraken heridentificatierisico's opleveren. Het bekende geval zijn LLM's die privégegevens uit trainingscorpora teruggeven (membership-inference- en memorization-aanvallen). Bij spraakmodellen is het risico kleiner, maar niet nul – stemfragmenten zijn biometrische gegevens.
Zo controleer je het: - Zoek in de voorwaarden op „Training\", „Improvement\", „Machine Learning\", „Customer Data\". - Controleer de privacyverklaring op „Used to improve our service\" – typisch vage formulering. - Vraag het DPA-sjabloon op en let op een clausule die gebruik voor training expliciet verbiedt. - Bij aanbieders van Fortune 500-niveau: vraag een compliance-sheet met klantspecifieke bevestiging op.
DeepScript traint geen enkel model op klantgegevens. We gebruiken een voorgetraind Whisper-compatibel model en finetunen uitsluitend op publiek gelicentieerde datasets (Common Voice, LibriSpeech, vrije Duitse corpora). Deze garantie staat in onze DPA en voorwaarden.
Gerelateerde vragen
Nog een vraag?
Drie transcripties gratis om uit te proberen. Of stuur ons een mailtje – we reageren binnen 24 uur, ook op compliancevragen.