Die stille Invasion: 1,52 Millionen KI-Anfragen pro Woche
LinkDaddy LLC hat eine bemerkenswerte Datensammlung veröffentlicht, die das Ausmaß der automatisierten Inhaltserfassung durch führende Tech-Konzerne offenlegt. Der Clearwater-basierte SEO- und Digital-Marketing-Spezialist konnte über Cloudflare-Aufzeichnungen dokumentieren, dass identifizierte KI-Crawler in einer rollierenden Sieben-Tage-Periode 1,52 Millionen Anfragen an öffentlich zugängliche, mit "AI Verified" gekennzeichnete Inhalte stellten. Diese Zahl ist beeindruckend – und beunruhigend zugleich.

Die erfassten Crawler stammen von den größten Namen der Branche: OpenAI (hinter ChatGPT), Meta (Facebook, Instagram), Amazon, Apple, Anthropic (Claude), Microsoft und Google. Auch der KI-Suchanbieter Perplexity ist in der Liste vertreten. Das zeigt, dass nicht nur spezialisierte KI-Unternehmen, sondern auch etablierte Tech-Konzerne mit gewaltigen Ressourcen aktiv am Sammeln von Trainingsmaterial sind. Hochgerechnet bedeuten 1,52 Millionen Anfragen pro Woche circa 79 Millionen Anfragen monatlich oder knapp eine Milliarde Anfragen jährlich.
Warum das "AI Verified"-Label ein neuer Schlüssel ist
LinkDaddy hatte die Möglichkeit geschaffen, dass Website-Betreiber ihre Inhalte explizit als "AI Verified" kennzeichnen können – ein Etikett, das Betreibern von KI-Trainingsmodellen signalisiert, dass der Content-Owner über maschinelle Nutzung informiert ist. Dies war eine Antwort auf die wachsende Frustration von Publishern, Journalisten und Kreativen, die ihre Arbeiten ohne Erlaubnis oder Kompensation in KI-Modelle einfließen sehen.
Die neue Datenerfassung zeigt jedoch, dass selbst explizite Kennzeichnungen die großen KI-Crawler nicht abhalten. Die 1,52 Millionen Anfragen deuten darauf hin, dass die markierten Inhalte für die KI-Unternehmen besonders wertvoll sind – vielleicht gerade weil sie als verifiziert gelten und höhere Qualität versprechen. Das ist ein klassisches Catch-22: Transparenz über die Nutzung führt nicht zu weniger Zugriff, sondern möglicherweise zu mehr.
Das Urheberrecht im Würgegriff der KI-Industrie
Diese Befunde wirfen ernsthafte juristische Fragen auf. In der EU prüft die Regulierung von KI-Trainingsmodellen intensiver, welche Anforderungen für die Datenerfassung gelten. In den USA hingegen wird die Frage "Fair Use" vs. "Unauthorized Scraping" noch vor Gericht geklärt. OpenAI, Google und andere Akteure argumentieren bislang, dass das Training von KI-Modellen auf öffentlich verfügbaren Inhalten unter Fair Use fällt. Publishers und Kreative sehen das fundamental anders und haben mehrere Klagen eingereicht.

LinkDaddys Bericht liefert erstmals konkrete Nachweise für die Skalierung dieser Aktivitäten. Eine Milliarde Anfragen jährlich klingt nicht nach experimentell oder marginal – es klingt nach Geschäftsmodellen, die bewusst auf massenhafte Datenerfassung angewiesen sind. Content-Creator könnten diese Daten in künftigen Rechtsstreiten als Beweis für systematische Nutzung verwenden.
Was bedeutet das für Content-Monetarisierung und Kontrolle?
Für Website-Betreiber und Content-Creator entstehen konkrete wirtschaftliche Risiken. Wenn große Teile ihrer Inhalte in KI-Modelle fließen, verlieren sie potenziell ihre Kontrolle über Nutzungs- und Monetarisierungsmöglichkeiten. Ein Journalist, dessen Recherche von ChatGPT zusammengefasst wird, konkurriert indirekt mit OpenAI um Leseraufmerksamkeit – ohne dafür entschädigt zu werden.
Manche Publisher haben bereits Robots.txt-Einträge oder paywalls implementiert, um Scraper auszusperren. Doch große Tech-Konzerne mit rechtlichen Ressourcen können diese Sperren umgehen oder rechtlich anfechten. Ohne regulatorische Klarheit bleibt Content-Creator nur der Weg zu besserer Technik oder Rechtsverfolgung. LinkDaddys Daten zeigen, dass das Problem nicht schrumpft – es wächst.
