Web-Scraping für KI-Training: Neue EDSA-Leitlinien

von | 01.10.2026 | Internet

Web-Scraping spielt eine wichtige Rolle beim Training moderner KI-Modelle. Doch genau diese Praxis gerät zunehmend unter Druck. Der Europäische Datenschutzausschuss (EDPB) hat bereits im Juli die Guidelines 03/2026 on web scraping in the context of generative AI verabschiedet und veröffentlicht, die den Umgang mit personenbezogenen Daten beim Scraping für generative KI-Modelle regeln.

Für Unternehmen, Entwickler und Datenschutzbeauftragte hat das erhebliche Konsequenzen — denn wer heute Trainingsdaten sammelt, trifft Entscheidungen, die morgen compliant sein müssen. Wir ordnen ein, was die Leitlinien bedeuten und worauf ihr euch einstellen solltet.

Was regeln die EDSA-Leitlinien zu Web-Scraping?

Der EDPB ist das Gremium, in dem die europäischen Datenschutzbehörden ihre Positionen abstimmen. Seine Leitlinien sind formal nicht bindend, haben in der Praxis aber enormes Gewicht — nationale Aufsichtsbehörden orientieren sich daran bei Prüfungen und Bußgeldern.

Laut einem aktuellen Monatsbericht zur KI-Regulierung hat der EDPB Leitlinien veröffentlicht, die sich speziell dem Web-Scraping im Kontext generativer KI widmen. Im Fokus stehen demnach die Rechtsgrundlagen für das Sammeln personenbezogener Daten, Transparenzpflichten gegenüber Betroffenen sowie Anforderungen an die Zweckbindung.

Die Guidelines 03/2026 sind öffentlich verfügbar und wurden vom EDPB am 8. Juli verabschiedet. Branchenbeobachter sehen darin eine Fortsetzung bestehender Positionen — etwa der früheren Stellungnahmen zu KI-Modellen und zum Verhältnis von Art. 6 DSGVO (Rechtsgrundlage) zu großflächigem Datenscraping.

Die Leitlinien enthalten detaillierte Vorgaben und Empfehlungen zu Rechtsgrundlagen, Transparenz und Datenminimierung. Die Richtung ist klar: Mehr Rechenschaftspflichten für alle, die Trainingsdaten aus dem offenen Netz ziehen.

Warum KI-Training Datenschutz jetzt reguliert wird

Das Spannungsfeld ist bekannt: Generative KI braucht gigantische Datenmengen. Vieles davon enthält personenbezogene Daten — Namen in Forenposts, Gesichter in Bildern, Profile aus sozialen Netzwerken. Betroffene wissen in der Regel nicht, dass ihre Inhalte in Trainingsdatensätzen landen.

Europäische Aufsichtsbehörden haben in den vergangenen Jahren Maßnahmen gegen KI-Anbieter ergriffen. Die italienische Garante etwa machte früh mit ChatGPT Schlagzeilen und ordnete zeitweise eine Aussetzung des Dienstes an. Die nun vorliegenden EDPB-Leitlinien schaffen eine gemeinsame Orientierung zur Nutzung von Web-Scraping für generative KI-Modelle.

Für euch als Unternehmen bedeutet das: Die Zeit, in der man sich auf das vage Argument „öffentlich zugänglich = frei verwendbar“ berufen konnte, geht zu Ende. Die DSGVO macht keinen Unterschied, ob Daten frei im Netz stehen oder nicht. Entscheidend bleibt die Rechtsgrundlage.

KI-Compliance vorbereiten: Checkliste für Unternehmen

EDSA,Web-Scraping,KI-Training,DSGVO,Datenschutz

Mit den nun vorliegenden Leitlinien lohnt es sich, die eigene Datenstrategie zu überprüfen. Die Grundprinzipien der DSGVO gelten ohnehin — die Leitlinien präzisieren sie, ersetzen sie nicht.

  • Datenquellen dokumentieren: Woher stammen eure Trainingsdaten? Welche Websites, welche Datensätze, welche Lizenzen?
  • Rechtsgrundlage prüfen: Berechtigtes Interesse (Art. 6 Abs. 1 lit. f DSGVO) ist möglich — aber nur nach sauberer Interessenabwägung mit dokumentiertem Ergebnis.
  • Robots.txt respektieren: Wer Opt-out-Signale ignoriert, verschlechtert seine Position in jeder späteren Abwägung.
  • Filter einbauen: Personenbezogene Daten, besonders sensible Kategorien, möglichst früh im Pipeline-Prozess entfernen.
  • Betroffenenrechte abbilden: Auskunft, Löschung, Widerspruch — auch bei trainierten Modellen eine echte Herausforderung.
  • Transparenz schaffen: Datenschutzhinweise, die ehrlich erklären, wie Trainingsdaten gewonnen werden.

Content-Creator und Website-Betreiber sitzen auf der anderen Seite des Tisches. Für euch gilt: Prüft, ob eure Nutzungsbedingungen klare Aussagen zum KI-Training enthalten. Technische Schutzmaßnahmen wie robots.txt-Einträge oder der Ausschluss von Websites, die Scraping klar ablehnen, werden in den EDPB-Leitlinien als empfohlene Maßnahmen beschrieben.

Legal-Teams sollten die Entwicklung eng beobachten. Sobald ein offizieller Entwurf vorliegt, startet üblicherweise eine öffentliche Konsultation. Das ist der Moment, in dem Branchenverbände und Unternehmen eigene Positionen einbringen können — und sollten.

Wie DSGVO und AI Act das KI-Training regulieren

Die EDPB-Leitlinien stehen nicht im luftleeren Raum. Parallel greift der EU AI Act, der eigene Transparenz- und Dokumentationspflichten für Anbieter sogenannter General-Purpose-AI-Modelle vorsieht. Beide Regelwerke überschneiden sich an vielen Stellen — und sie können widersprüchliche Anforderungen produzieren.

Für Unternehmen heißt das: Compliance beim Thema KI-Training wird zur Querschnittsaufgabe. Datenschutz, IT-Sicherheit, Produktentwicklung und Rechtsabteilung müssen enger zusammenrücken. Wer bisher mit einer isolierten Datenschutzerklärung arbeitet, wird das überdenken müssen.

Einschätzung: Die Zukunft von Web-Scraping und KI

Die Guidelines 03/2026 des EDPB liegen öffentlich vor und enthalten detaillierte Vorgaben und Empfehlungen zu Rechtsgrundlagen, Transparenz und Datenminimierung. Die Richtung ist klar: Europa will Web-Scraping für KI-Training enger regulieren, Transparenz einfordern und Betroffenenrechte stärken.

Wer heute saubere Prozesse aufsetzt — mit dokumentierten Datenquellen, klarer Rechtsgrundlage und respektierten Opt-out-Signalen — hat später weniger Nachrüstbedarf. Und ehrlich: Die meisten dieser Maßnahmen sind ohnehin schon DSGVO-Pflicht, nicht erst nach einer neuen Leitlinie. Wir behalten das Thema im Auge und berichten, sobald der EDPB weitere Entwicklungen veröffentlicht.

Quellen und Prüfstand

Hinweis: Zu diesem Thema lag zum Redaktionsschluss keine offizielle Bestätigung der beteiligten Unternehmen vor. Die Angaben stützen sich auf Medienberichte.

Faktenprüfung: Alle überprüfbaren Aussagen wurden am 01.10.2026 automatisiert gegen die offiziellen Primärquellen abgeglichen. Stand des Artikels: 01.10.2026.

Superkraft KI

Bei dem Tempo den Überblick zu behalten, ist die eigentliche Kunst.

Den Überblick behalten, ohne jeden Hype mitzumachen – dabei hilft dir Superkraft KI Unlimited.

Jetzt Superkraft KI Unlimited entdecken →
Jörg Schieb
Noch Fragen? Frag mich.

Du hast eine Frage zu diesem Thema? Ich hab die Antwort.

Stell sie einfach — so, wie sie dir gerade einfällt. Du bekommst eine Antwort aus meinen über 20.000 geprüften Beiträgen. Mit Quelle zum Nachlesen. Die erste Frage ist kostenlos.

✅ Geprüftes Wissen statt KI-Raterei 📄 Mit Quelle zum Nachlesen 🆓 Erste Frage gratis
Jörg Schieb – Profil