I miei file audio vengono usati per addestrare modelli di IA?
Risposta breve
Con alcuni fornitori statunitensi sì, a meno che tu non ti opponga attivamente. I fornitori seri lo escludono per contratto – chiedi e leggi le condizioni.
La risposta dipende interamente dal fornitore e determina quanto sono davvero sicuri i tuoi dati. Tre modelli tipici:
1. Addestramento predefinito sui dati dei clienti (opt-out). Alcuni fornitori cloud statunitensi usano i dati dei clienti per addestrare i propri modelli, a meno che tu non ti opponga attivamente. OpenAI all'inizio lo aveva attivato per l'API di ChatGPT, poi lo ha disattivato come impostazione predefinita per l'API – presso altri fornitori la situazione è disomogenea. I fornitori di speech-to-text usano spesso l'audio dei clienti come « segnale di miglioramento \" per i propri modelli acustici e linguistici.
2. Opt-in all'addestramento. Altri fornitori per impostazione predefinita non addestrano sui dati dei clienti, ma attirano con sconti (« Attiva la condivisione dei dati per il 30% di sconto \"). È più trasparente, ma pericoloso, perché un dipendente può spuntare la casella senza pensarci.
3. Esclusione contrattuale. I fornitori seri escludono esplicitamente l'uso per l'addestramento nelle proprie condizioni standard e nel DPA. L'Art. 28 Abs. 3 lit. a GDPR richiede comunque che il responsabile del trattamento tratti i dati solo su istruzione documentata del titolare – un addestramento per le proprie finalità sarebbe una violazione.
Perché è rilevante: se il tuo audio finisce nei dati di addestramento, espressioni rare possono creare rischi di reidentificazione. Il caso noto è quello degli LLM che restituiscono dati privati dai corpora di addestramento (attacchi di membership inference e memorization). Per i modelli vocali il rischio è minore ma non nullo – i campioni di voce sono dati biometrici.
Come verificarlo: - Cercare nelle condizioni « Training \", « Improvement \", « Machine Learning \", « Customer Data \". - Controllare nella privacy policy « Used to improve our service \" – formulazione tipicamente vaga. - Richiedere il modello di DPA e cercare una clausola che vieti esplicitamente l'uso per l'addestramento. - Per i fornitori di livello Fortune 500: richiedere una scheda di conformità con conferma specifica per il cliente.
DeepScript non addestra alcun modello sui dati dei clienti. Usiamo un modello pre-addestrato compatibile con Whisper e lo finetuniamo esclusivamente su set di dati con licenza pubblica (Common Voice, LibriSpeech, corpora tedeschi liberi). Questa garanzia è contenuta nel DPA e nelle condizioni.
Domande correlate
Ti è rimasta una domanda?
Tre trascrizioni gratuite da provare. Oppure scrivici un'e-mail – rispondiamo entro 24 ore, anche per le domande sulla conformità.