Czy moje pliki audio są wykorzystywane do trenowania modeli SI?
Krótka odpowiedź
U niektórych dostawców z USA tak, o ile aktywnie się nie sprzeciwisz. Poważni dostawcy wykluczają to umownie – zapytaj i sprawdź regulamin.
Odpowiedź zależy w całości od dostawcy i decyduje o tym, jak bezpieczne są naprawdę Twoje dane. Trzy typowe modele:
1. Domyślne trenowanie na danych klientów (opt-out). Niektórzy amerykańscy dostawcy chmury wykorzystują dane klientów do trenowania swoich modeli, o ile aktywnie się temu nie sprzeciwisz. OpenAI początkowo włączyło to dla API ChatGPT, później wyłączyło to domyślnie dla API – u innych dostawców sytuacja jest niejednolita. Dostawcy speech-to-text często wykorzystują audio klientów jako „sygnał poprawy\" dla swoich modeli akustycznych i językowych.
2. Opt-in do trenowania. Inni dostawcy domyślnie nie trenują na danych klientów, ale kuszą rabatami („Włącz udostępnianie danych, aby uzyskać 30% rabatu\"). Jest to bardziej przejrzyste, ale niebezpieczne, ponieważ pracownik może bezrefleksyjnie zaznaczyć pole.
3. Wykluczenie umowne. Poważni dostawcy wyraźnie wykluczają wykorzystanie do trenowania w swoich standardowych warunkach i w DPA. Art. 28 Abs. 3 lit. a RODO i tak wymaga, by podmiot przetwarzający przetwarzał dane wyłącznie na udokumentowane polecenie administratora – trenowanie do własnych celów byłoby naruszeniem.
Dlaczego to istotne: jeśli Twoje audio trafi do danych treningowych, rzadkie wypowiedzi mogą rodzić ryzyko ponownej identyfikacji. Znanym przypadkiem są modele LLM zwracające dane prywatne z korpusów treningowych (ataki typu membership inference i memorization). W modelach mowy ryzyko jest mniejsze, ale niezerowe – próbki głosu to dane biometryczne.
Jak to sprawdzić: - Przeszukaj warunki pod kątem „Training\", „Improvement\", „Machine Learning\", „Customer Data\". - Sprawdź w polityce prywatności „Used to improve our service\" – typowo nieostre sformułowanie. - Poproś o wzór DPA i zwróć uwagę na klauzulę wyraźnie zakazującą wykorzystania do trenowania. - U dostawców klasy Fortune 500: poproś o arkusz zgodności z potwierdzeniem specyficznym dla klienta.
DeepScript nie trenuje żadnych modeli na danych klientów. Korzystamy z wstępnie wytrenowanego modelu zgodnego z Whisper i finetunujemy go wyłącznie na publicznie licencjonowanych zbiorach danych (Common Voice, LibriSpeech, wolne korpusy niemieckie). Ta gwarancja jest zapisana w naszym DPA i regulaminie.
Powiązane pytania
Masz jeszcze pytanie?
Trzy transkrypcje za darmo na próbę. Albo napisz do nas e-mail – odpowiadamy w ciągu 24 godzin, również na pytania dotyczące zgodności.