DeepScript
Domanda

I miei file audio vengono usati per addestrare modelli di IA?

Risposta breve

Con alcuni fornitori statunitensi sì, a meno che tu non ti opponga attivamente. I fornitori seri lo escludono per contratto – chiedi e leggi le condizioni.

La risposta dipende interamente dal fornitore e determina quanto sono davvero sicuri i tuoi dati. Tre modelli tipici:

1. Addestramento predefinito sui dati dei clienti (opt-out). Alcuni fornitori cloud statunitensi usano i dati dei clienti per addestrare i propri modelli, a meno che tu non ti opponga attivamente. OpenAI all'inizio lo aveva attivato per l'API di ChatGPT, poi lo ha disattivato come impostazione predefinita per l'API – presso altri fornitori la situazione è disomogenea. I fornitori di speech-to-text usano spesso l'audio dei clienti come « segnale di miglioramento \" per i propri modelli acustici e linguistici.

2. Opt-in all'addestramento. Altri fornitori per impostazione predefinita non addestrano sui dati dei clienti, ma attirano con sconti (« Attiva la condivisione dei dati per il 30% di sconto \"). È più trasparente, ma pericoloso, perché un dipendente può spuntare la casella senza pensarci.

3. Esclusione contrattuale. I fornitori seri escludono esplicitamente l'uso per l'addestramento nelle proprie condizioni standard e nel DPA. L'Art. 28 Abs. 3 lit. a GDPR richiede comunque che il responsabile del trattamento tratti i dati solo su istruzione documentata del titolare – un addestramento per le proprie finalità sarebbe una violazione.

Perché è rilevante: se il tuo audio finisce nei dati di addestramento, espressioni rare possono creare rischi di reidentificazione. Il caso noto è quello degli LLM che restituiscono dati privati dai corpora di addestramento (attacchi di membership inference e memorization). Per i modelli vocali il rischio è minore ma non nullo – i campioni di voce sono dati biometrici.

Come verificarlo: - Cercare nelle condizioni « Training \", « Improvement \", « Machine Learning \", « Customer Data \". - Controllare nella privacy policy « Used to improve our service \" – formulazione tipicamente vaga. - Richiedere il modello di DPA e cercare una clausola che vieti esplicitamente l'uso per l'addestramento. - Per i fornitori di livello Fortune 500: richiedere una scheda di conformità con conferma specifica per il cliente.

DeepScript non addestra alcun modello sui dati dei clienti. Usiamo un modello pre-addestrato compatibile con Whisper e lo finetuniamo esclusivamente su set di dati con licenza pubblica (Common Voice, LibriSpeech, corpora tedeschi liberi). Questa garanzia è contenuta nel DPA e nelle condizioni.

Domande correlate

Ti è rimasta una domanda?

Tre trascrizioni gratuite da provare. Oppure scrivici un'e-mail – rispondiamo entro 24 ore, anche per le domande sulla conformità.

I miei dati audio verranno usati per addestrare modelli di IA? | DeepScript