Eine der folgenreichsten medienpolitischen Weichenstellungen der vergangenen Jahre steht in einer Textdatei von wenigen Zeilen. Sie heißt robots.txt. Die Datei liegt im Wurzelverzeichnis jeder Website und legt fest, welche Programme dort lesen dürfen.
Verlage, Behörden und Forschungseinrichtungen entscheiden dort einzeln, ob GPTBot, ClaudeBot, PerplexityBot, Google-Extended oder CCBot Zugriff bekommen, und weil jedes Haus für sich entscheidet, ergibt sich zusammengenommen eine Quellenlage, die niemand beschlossen hat und für die niemand zuständig ist.
Eine Textdatei als VerhandlungspositionDie Datei ist kein Schutzmechanismus, sondern eine Bitte, an die sich die großen Anbieter halten. Genau darin liegt ihr politischer Gehalt. Wer sperrt, entzieht seine Inhalte der Weiterverwendung und verliert zugleich die Chance, in Antworten genannt zu werden. Wer öffnet, gewinnt Sichtbarkeit ohne Gegenleistung.
Einige Häuser haben aus dieser Lage Verhandlungen gemacht und Lizenzvereinbarungen geschlossen. Für kleinere Redaktionen, kommunale Stellen oder Fachverbände existiert dieser Weg praktisch nicht. Ihnen bleibt die Textdatei.
Die Entscheidung fällt selten dort, wo sie hingehört. In vielen Häusern liegt die Datei bei der Technik, während die Folgen die Redaktion und die Erlösseite treffen. Ein kurzer, dokumentierter Beschluss darüber, wer welchen Crawler zulässt und warum, erspart die spätere Rekonstruktion.
Sperren schützt, kostet aber SichtbarkeitDie Abwägung fällt leichter, wenn man sie in zwei Fragen zerlegt: Was verliert eine Organisation, wenn ihre Inhalte in fremden Antworten auftauchen, und was verliert sie, wenn sie dort fehlen. Für eine Redaktion, die von Reichweite lebt, fällt die Rechnung anders aus als für ein Archiv mit ungeklärten Rechten.
Vor dieser Entscheidung steht sinnvollerweise eine Bestandsaufnahme der eigenen Sichtbarkeit, weil sonst über einen Verlust gestritten wird, dessen Umfang niemand kennt. Wer nicht weiß, ob er heute genannt wird, kann auch nicht beurteilen, was eine Sperre kostet.
Grafik: Der erste Schritt ist eine politische, die übrigen sind handwerkliche Entscheidungen Was in einer Antwort geschieht, das in einer Trefferliste nicht geschahEine Trefferliste zeigt Alternativen nebeneinander und überlässt die Auswahl der Leserin. Eine Antwort trifft sie bereits. Das Ergebnis kommt in geschlossener Form. Was aus mehreren Quellen zusammengesetzt wurde, erscheint als eine Stimme, und Widersprüche zwischen den Quellen verschwinden im Satzbau.
Für die öffentliche Debatte ist das der entscheidende Unterschied, denn die Frage, welche Perspektiven es zu einem Thema gibt, wird strukturell schlechter beantwortet als die Frage, was der Fall ist.
Warum kleinere Stimmen strukturell im Nachteil sindSysteme, die auf Übereinstimmung setzen, bevorzugen, was oft und ähnlich formuliert vorliegt, und regionale Publikationen, Beiträge in kleineren Sprachen sowie spezialisierte Fachtexte erfüllen dieses Kriterium seltener, auch wenn sie näher an der Sache sind.
Wer verstehen will, wie diese Auswahl zustande kommt, kommt an der Beobachtung nicht vorbei, dass Häufigkeit und Klarheit stärker wirken als Nähe zum Gegenstand. Ein Vorwurf an die Technik liegt darin nicht. Es ist eine Eigenschaft des Verfahrens, mit der Redaktionen rechnen müssen.
Kleinere Häuser müssen sich praktisch auf ein Feld konzentrieren. Breite hilft ihnen nicht. Eine Redaktion, die zu einem regionalen Thema die vollständigste Darstellung liefert, wird eher herangezogen als eine, die zu allem etwas hat.
Was Redaktionen und Institutionen praktisch tun könnenVier Dinge helfen unabhängig von der politischen Bewertung: eine bewusst gepflegte robots.txt statt der Voreinstellung des Systems, klare Autorenschaft mit Namen und Datum, semantisches HTML, damit Struktur überhaupt ankommt, und Kernaussagen, die als einzelner Satz zitierfähig sind.
Der letzte Punkt fällt Journalistinnen und Journalisten am schwersten, weil er dem Handwerk widerspricht, eine Aussage erst aufzubauen. Für die Auffindbarkeit gilt trotzdem: Was nicht in einem Satz belegbar dasteht, wird selten übernommen.
Häufige Fragen Verpflichtet europäisches Recht KI-Anbieter dazu, Quellen zu nennen?Transparenzpflichten für generative Systeme sind Gegenstand der europäischen KI-Regulierung, eine allgemeine Pflicht, in jeder Antwort einzelne Webquellen zu nennen, ergibt sich daraus jedoch nicht. Ob und wie zitiert wird, entscheidet in der Praxis der jeweilige Anbieter.
Was ist der Unterschied zwischen Googlebot und Google-Extended?Der Googlebot sammelt für die klassische Websuche. Google-Extended ist eine zusätzliche Kennung, über die sich steuern lässt, ob Inhalte für generative Antworten verwendet werden. Eine Sperre für Google-Extended verändert die Position in der normalen Suche nicht.
Lohnt sich eine Sperre, wenn die Inhalte längst gelesen wurden?Für bereits vorhandene Datenbestände ändert eine spätere Sperre nichts. Sie wirkt in die Zukunft. Betroffen sind vor allem Abrufe, die im Moment einer Nutzerfrage erfolgen. Sie ist damit eher eine Entscheidung über die kommenden Jahre als über die vergangenen.
Der Beitrag Wer entscheidet, welche Quellen in KI-Antworten auftauchen erschien zuerst auf Neurope.eu - News aus Europa.