DeepScript
Pregunta

¿Se usan mis archivos de audio para entrenar modelos de IA?

Respuesta corta

Con algunos proveedores estadounidenses, sí, salvo que te opongas activamente. Los proveedores serios lo excluyen por contrato – pregunta y lee las condiciones.

La respuesta depende por completo del proveedor y determina lo seguros que están realmente tus datos. Tres modelos típicos:

1. Entrenamiento por defecto con datos de clientes (opt-out). Algunos proveedores de nube estadounidenses usan los datos de clientes para entrenar sus modelos, salvo que te opongas activamente. OpenAI lo había activado al principio para la API de ChatGPT y luego lo desactivó por defecto para la API – en otros proveedores la situación es dispar. Los proveedores de speech-to-text suelen usar el audio de los clientes como « señal de mejora \" para sus modelos acústicos y lingüísticos.

2. Opt-in al entrenamiento. Otros proveedores no entrenan por defecto con los datos de clientes, pero atraen con descuentos (« Activa el uso compartido de datos por un 30% de descuento \"). Es más transparente, pero peligroso, porque un empleado puede marcar la casilla sin pensar.

3. Exclusión contractual. Los proveedores serios excluyen explícitamente el uso para entrenamiento en sus condiciones estándar y en el DPA. El Art. 28 Abs. 3 lit. a RGPD exige de todos modos que el encargado del tratamiento trate los datos solo siguiendo instrucciones documentadas del responsable – un entrenamiento con fines propios sería una infracción.

Por qué es relevante: si tu audio acaba en datos de entrenamiento, las expresiones poco frecuentes pueden generar riesgos de reidentificación. El caso conocido es el de los LLM que devuelven datos privados de los corpus de entrenamiento (ataques de inferencia de pertenencia y de memorización). En los modelos de voz el riesgo es menor, pero no nulo – las muestras de voz son datos biométricos.

Cómo comprobarlo: - Busca en las condiciones « Training \", « Improvement \", « Machine Learning \", « Customer Data \". - Revisa en la política de privacidad « Used to improve our service \" – formulación típicamente vaga. - Solicita la plantilla de DPA y fíjate en una cláusula que prohíba explícitamente el uso para entrenamiento. - En proveedores de nivel Fortune 500: solicita una ficha de conformidad con confirmación específica para el cliente.

DeepScript no entrena ningún modelo con datos de clientes. Usamos un modelo preentrenado compatible con Whisper y lo finetuneamos exclusivamente con conjuntos de datos con licencia pública (Common Voice, LibriSpeech, corpus alemanes libres). Esta garantía consta en nuestro DPA y en nuestras condiciones.

Preguntas relacionadas

¿Te queda alguna pregunta?

Tres transcripciones gratis para probar. O escríbenos un correo – respondemos en menos de 24 horas, también a preguntas de cumplimiento.

¿Se usarán mis datos de audio para entrenar modelos de IA? | DeepScript