Zum Inhalt

IFG und Datenschutz

Jahrestagung · St. Pölten · 21.–22. September 2026

Qualität

Anonymisierung von KI-Trainingsdaten

Gericht
nicht erkannt
Datum
21.09.2026
Geschäftszahl
nicht erkannt
Dokumenttyp
Vortrag

DatenschutzVortrag

Univ.-Prof. Dr.-Ing. Frank Pallas, Universität Salzburg · 21.09.2026

k-Anonymität, l-Diversität, Differential Privacy

Kurzfassung

Anonymisierung ist relativ und risikobezogen. Entscheidend ist nicht ein Bauchgefühl zu Geburtsjahr und Postleitzahl, sondern eine nachvollziehbare Abwägung aus formaler Garantie und Verlust an Nutzbarkeit.

Aus der Unterlage

  • Privacy by Design meint alle Grundsätze, nicht nur Sicherheit: Rechtmäßigkeit, Zweckbindung, Datenminimierung, Transparenz, Richtigkeit, Rechenschaft.
  • Trainingsdaten sollen so depersonalisiert werden, dass das Modell keine personenbezogenen Daten preisgibt, etwa den Gesundheitsstatus von Ausreißern.
  • Die Frage lautet: Wann ist Re-Identifikation im Einzelfall „reasonably unlikely“, und wie viel Anonymisierung ist risikoangemessen? Mitzudenken sind Kosten und der Verlust an Aussagekraft.
  • Alte Praxis (Geburtstag auf Zehnjahreskohorten, letzte PLZ-Ziffer streichen) scheitert an Ausreißern und fehlender Vielfalt.
  • Heute zählen Ausgangsmetriken: k-Anonymität, l-Diversität und Differential Privacy (Epsilon). Welches k, l oder Epsilon den besten Ausgleich bietet, ist experimentell am konkreten Datensatz zu prüfen, nicht pauschal festzulegen.
  • Eigene Versuche: Auch starker Informationsverlust in den Trainingsdaten kann die Klassifikation kaum verschlechtern, je nach Fall aber erheblich. Bei einer Netzlastvorhersage aus Smart-Meter-Daten stieg der relative Vorhersagefehler von 7,7 Prozent (Rohdaten) auf 12,1 Prozent (Local Differential Privacy, Epsilon 0,5). Ob das angemessen ist, bleibt die Abwägungsfrage.
  • Bei großen Sprachmodellen sind Trainingsdaten meist unstrukturierter Text oder Bilder. Formale Anonymitätsmetriken greifen dort kaum. Stand der Technik laut Folie: Blackbox-Tests, welche personenbezogenen Daten das Modell ausgibt.
  • Dieselbe Logik trägt die IFG-Judikatur zur Re-Identifikation: Namenstreichen allein ist keine Anonymisierung. Das BVwG zieht bei Prüfungsstatistiken eine Schwelle von fünf Personen je Lehrveranstaltung.

AnonymisierungTrainingsdatenRe-Identifikationk-AnonymitätDifferential PrivacyDatenminimierung

Originalquelle

Univ.-Prof. Dr.-Ing. Frank Pallas, Universität Salzburg. Dokumenttyp: Vortrag. Eine Originalentscheidung ist nicht hinterlegt.

Ähnliche Entscheidungen