BSI KI-Agenten: Neue Prüfanforderungen für mehr Sicherheit
PRAKI soll neue Prüfanforderungen entwickeln und die Sicherheit agentischer KI systematisch bewerten.
Interne Dokumente zeigen Zweifel am KI-Training und neue Fragen zu Trainingsdaten und Governance.

Neu entsiegelte Gerichtsunterlagen bringen interne Diskussionen bei Microsoft und OpenAI ans Licht. Im Zentrum stehen Fragen zum KI-Training mit journalistischen Inhalten und zur rechtlichen Einordnung unter dem US-amerikanischen Fair-Use-Prinzip.
Für Unternehmen ist der Fall vor allem deshalb relevant, weil er die Herkunft und Nutzung von Trainingsdaten stärker in den Fokus rückt. Wer eigene KI-Systeme trainiert, Modelle nachtrainiert oder externe Inhalte in RAG-Systeme einbindet, sollte Datenquellen und Nutzungsrechte nachvollziehbar dokumentieren.
Die Unterlagen stammen aus dem laufenden Copyright-Verfahren der New York Times und weiterer Medienunternehmen gegen OpenAI und Microsoft. Teile des Materials waren zuvor geschwärzt und wurden Mitte September öffentlich zugänglich.
Besondere Aufmerksamkeit erhielt eine interne Aussage von Brent Hecht, Director of Applied Science bei Microsoft. Er bezeichnete das Training von KI-Modellen mit menschlich erstellten Inhalten intern als möglichen „largest theft of labor in human history“. Microsoft erklärte gegenüber der Washington Post, dies sei die persönliche Sicht eines Mitarbeiters. Die Aussage sei weder eine juristische Bewertung noch die Position des Unternehmens.
Damit handelt es sich nicht um ein Eingeständnis Microsofts. Die Aussage ist Teil des Beweismaterials, mit dem die Kläger ihre Argumentation stützen wollen.
Die entsiegelten Unterlagen enthalten weitere interne Diskussionen über die Auswirkungen generativer KI auf Medienunternehmen. Nach Darstellung der Kläger zeigen sie, dass Beschäftigte mögliche Marktfolgen und den Umgang mit journalistischen Inhalten intern thematisierten.
TechCrunch berichtet zudem über Vorwürfe, wonach Inhalte über verschiedene Datensätze und Quellen in Trainingsmaterial gelangt seien. Dazu gehören laut Klägerschrift auch große Mengen journalistischer Inhalte aus Web-Crawls. Diese Angaben stammen aus dem Vortrag der Kläger und sind keine gerichtlichen Feststellungen.
Der Fall zeigt damit, wie wichtig die Herkunft von Daten für KI-Projekte geworden ist. Eine ähnliche Governance-Frage stellt sich bereits beim produktiven Einsatz von Microsoft KI-Agenten, wenn Systeme auf interne und externe Datenquellen zugreifen.
Die Kläger werfen OpenAI und Microsoft vor, geschützte Inhalte ohne ausreichende Erlaubnis für Entwicklung und Training generativer KI verwendet zu haben. Sie argumentieren außerdem, dass daraus Produkte entstanden seien, die mit journalistischen Angeboten konkurrieren könnten.
OpenAI weist diese Darstellung zurück. Das Unternehmen beruft sich auf Fair Use und argumentiert, dass die Nutzung öffentlich zugänglicher Inhalte für das Training einen transformativen Zweck erfülle. Am 4. September reichte OpenAI dazu Anträge auf Summary Judgment ein.
Eine gerichtliche Entscheidung über die zentrale Copyright-Frage liegt weiterhin nicht vor. Auch die neu veröffentlichten internen Aussagen beantworten nicht, ob das konkrete Training rechtmäßig war.
Das Fair-Use-Prinzip erlaubt im US-Recht unter bestimmten Voraussetzungen auch die Nutzung urheberrechtlich geschützter Werke ohne individuelle Lizenz. Ob dies beim Training generativer KI greift, hängt jedoch vom konkreten Fall ab.
Die Argumentation hat inzwischen zusätzliche politische Bedeutung erhalten. Das US-Justizministerium hat eine sogenannte Statement of Interest eingereicht und darin eine breite Anwendung von Fair Use beim KI-Training unterstützt. Die Eingabe ist für das Gericht nicht bindend. Axios berichtete zudem, dass die Position innerhalb der US-Verwaltung nicht vollständig abgestimmt gewesen sei.
Für deutsche und europäische Unternehmen lässt sich daraus keine direkte Rechtsposition ableiten. Das Verfahren findet nach US-Recht statt. Die Anforderungen an Urheberrecht, Datenschutz und Datenzugriff können sich in anderen Rechtsräumen deutlich unterscheiden.
Für IT-Verantwortliche entsteht daraus eine praktische Governance-Frage: Können Unternehmen nachvollziehen, welche Daten in eigene KI-Systeme einfließen und auf welcher Grundlage sie genutzt werden?
Das betrifft besonders eigene Trainingsdaten, Fine-Tuning und RAG-Anwendungen. Bei RAG werden Inhalte typischerweise zur Laufzeit abgerufen und dem Modell als Kontext bereitgestellt. Beim Fine-Tuning oder eigenen Training können Inhalte dagegen dauerhaft in die Modellentwicklung einfließen. Beide Ansätze schaffen unterschiedliche technische und rechtliche Anforderungen.
Auch die Eingabe sensibler Unternehmensinformationen bleibt relevant. Ansätze wie ein Privacy Gateway sollen Daten bereits vor der Übertragung an externe Modelle filtern. Für Microsoft-Umgebungen gehören zudem Berechtigungen und Datenhygiene zu einer sauberen Copilot Readiness.
Der OpenAI-Copyright-Streit ist noch nicht entschieden. Die entsiegelten Dokumente zeigen jedoch, dass die Herkunft, Auswahl und rechtliche Grundlage von Trainingsdaten nicht nur juristische Randfragen sind.
Unternehmen sollten deshalb dokumentieren, welche Datenquellen sie für Training, Fine-Tuning oder RAG einsetzen. Ebenso wichtig sind klare Zuständigkeiten für Nutzungsrechte, Datenklassifizierung und Freigaben. Damit lassen sich rechtliche Risiken nicht vollständig ausschließen, aber technisch und organisatorisch besser kontrollieren.
Weitere Einordnungen zu KI, Cloud und Infrastruktur veröffentlicht IT-Dock regelmäßig im Newsletter: https://it-dock.de/#newsletter.
Kommentare (0)
Noch keine Kommentare vorhanden.