DeepScript
Question

Mes fichiers audio sont-ils utilisés pour entraîner des modèles d'IA ?

Réponse courte

Chez certains prestataires américains, oui, sauf si vous vous y opposez activement. Les prestataires sérieux l'excluent par contrat – posez la question et lisez les conditions générales.

La réponse dépend entièrement du prestataire et détermine la sécurité réelle de vos données. Trois modèles typiques :

1. Entraînement par défaut sur les données clients (opt-out). Certains prestataires cloud américains utilisent les données clients pour entraîner leurs modèles, sauf si vous vous y opposez activement. OpenAI avait d'abord activé cela pour l'API ChatGPT, puis l'a désactivé par défaut pour l'API – chez d'autres prestataires, la situation est hétérogène. Les fournisseurs de speech-to-text utilisent souvent l'audio des clients comme « signal d'amélioration \" pour leurs modèles acoustiques et linguistiques.

2. Opt-in à l'entraînement. D'autres prestataires n'entraînent pas par défaut sur les données clients, mais attirent avec des remises (« Activez le partage de données pour 30 % de réduction \"). C'est plus transparent, mais dangereux, car un salarié peut cocher la case sans réfléchir.

3. Exclusion contractuelle. Les prestataires sérieux excluent explicitement l'usage pour l'entraînement dans leurs conditions générales standard et dans le DPA. L'Art. 28 Abs. 3 lit. a RGPD exige de toute façon que le sous-traitant ne traite les données que sur instruction documentée du responsable – un entraînement à ses propres fins constituerait une violation.

Pourquoi c'est important : si votre audio entre dans les données d'entraînement, des énoncés rares peuvent créer des risques de réidentification. L'exemple connu est celui des LLM qui restituent des données privées issues de corpus d'entraînement (attaques par inférence d'appartenance et par mémorisation). Pour les modèles vocaux, le risque est moindre mais non nul – les échantillons de voix sont des données biométriques.

Comment le vérifier : - Rechercher dans les conditions générales « Training \", « Improvement \", « Machine Learning \", « Customer Data \". - Chercher dans la politique de confidentialité « Used to improve our service \" – formulation typiquement floue. - Demander le modèle de DPA et repérer une clause qui interdit explicitement l'usage pour l'entraînement. - Pour les prestataires de niveau Fortune 500 : demander une fiche de conformité avec une confirmation spécifique au client.

DeepScript n'entraîne aucun modèle sur les données clients. Nous utilisons un modèle pré-entraîné compatible Whisper et le finetunons exclusivement sur des jeux de données sous licence publique (Common Voice, LibriSpeech, corpus allemands libres). Cette garantie figure dans le DPA et les conditions générales.

Questions associées

Une question reste sans réponse ?

Trois transcriptions gratuites pour essayer. Ou écrivez-nous un e-mail – nous répondons sous 24 heures, questions de conformité comprises.

Mes données audio seront-elles utilisées pour entraîner des modèles d'IA ? | DeepScript