KI-Crawler, robots.txt und llms.txt: Was Praxen einstellen sollten
SEO und SichtbarkeitPraxis

KI-Crawler, robots.txt und llms.txt: Was Praxen einstellen sollten

Wer in ChatGPT, Perplexity oder Gemini als Quelle auftauchen will, muss deren Crawler auf die Website lassen. Viele Praxis-Websites sperren sie, ohne es zu wissen.

Frank Randel

Von Frank Randel, CEO + IT-Architektur

· 5 min Lesezeit

Wer hier schreibt

Frank Randel

CEO + IT-Architektur

Er entwirft mit Ihnen den Plan für Ihre Praxis und begleitet Sie, bis Design, Technik und Team zusammenpassen.

Fachartikel
11
Leistungen verantwortet
6
Mehr über Frank

ChatGPT, Perplexity, Gemini und Claude beantworten Patientenfragen mit Inhalten aus dem Netz. Dafür schicken die Anbieter Programme los, die Websites lesen: KI-Crawler. Welche davon Ihre Praxis-Website lesen dürfen, legt eine kleine Textdatei fest, die robots.txt. Steht dort das Falsche, kommt Ihre Praxis in KI-Antworten nicht als Quelle vor, egal wie gut die Inhalte sind.

In diesem Artikel zeigen wir, welche Crawler es gibt, welche eine Praxis zulassen sollte, wie die Einträge aussehen und was es mit der neuen llms.txt auf sich hat.

„Antwortsysteme herein, reine Sammler hinaus. Nach dieser Regel haben wir unsere eigene Website eingestellt.“

Frank Randel, CEO + IT-Architektur

Was sind KI-Crawler?

KI-Crawler
Programme, mit denen Anbieter wie OpenAI, Anthropic, Perplexity oder Google Websites lesen. Ein Teil sammelt Material für das Training der Modelle, ein anderer holt Inhalte für Antworten in der KI-Suche.

Für Praxen ist diese Unterscheidung der Kern: Such-Crawler entscheiden darüber, ob Ihre Website in einer KI-Antwort als Quelle genannt werden kann. Trainings-Crawler sammeln Texte, aus denen künftige Modelle lernen. Den einen auszusperren, kostet Sichtbarkeit, den anderen auszusperren, ist eine Frage Ihrer Haltung.

Die wichtigsten KI-Crawler und was sie tun
CrawlerAnbieterZweckEmpfehlung für Praxen
OAI-SearchBotOpenAISuchergebnisse in ChatGPTzulassen
ChatGPT-UserOpenAIruft eine Seite ab, wenn jemand im Chat danach fragtzulassen
GPTBotOpenAITraining der ModelleIhre Entscheidung
Claude-SearchBotAnthropicSuchergebnisse in Claudezulassen
Claude-UserAnthropicruft eine Seite ab, wenn jemand in Claude danach fragtzulassen
ClaudeBotAnthropicTraining der ModelleIhre Entscheidung
PerplexityBotPerplexityIndex für Antworten in Perplexityzulassen
Perplexity-UserPerplexityruft eine Seite ab, wenn jemand danach fragtzulassen
Google-ExtendedGoogleTraining von Gemini und Antworten in der Gemini-App, nicht die Google-Suchezulassen, wenn Sie in Gemini vorkommen wollen
BingbotMicrosoftBing-Index, genutzt von Copilot und als Suchpartner von ChatGPTzulassen

Stand Oktober 2026, laut den Angaben von OpenAI, Anthropic, Perplexity und Google. Die Anbieter ändern ihre Crawler gelegentlich.

Wichtig für Google: Die KI-Übersichten in der Google-Suche entstehen aus dem normalen Google-Index. Google schreibt ausdrücklich, dass Google-Extended keinen Einfluss auf die Aufnahme in die Google-Suche hat (Google Search Central). Wer Googlebot zulässt, kann in den KI-Übersichten vorkommen.

So sieht die robots.txt aus

Die robots.txt liegt im Hauptverzeichnis Ihrer Website. Jeder Block nennt einen Crawler und sagt, was er darf. Für eine Praxis, die in KI-Antworten vorkommen will, reichen wenige Zeilen:

Beispiel-Einträge, jeweils in eigenen Zeilen
EintragBedeutung
User-agent: OAI-SearchBot · Allow: /ChatGPT-Suche darf die ganze Website lesen
User-agent: Claude-SearchBot · Allow: /Claude-Suche darf die ganze Website lesen
User-agent: PerplexityBot · Allow: /Perplexity darf die ganze Website lesen
User-agent: GPTBot · Disallow: /Beispiel: OpenAI darf die Website nicht für das Training nutzen
User-agent: * · Allow: /alle anderen Crawler dürfen lesen
Quick-Tipp
Ein Crawler ohne eigenen Block folgt den Regeln unter „User-agent: *“. Steht dort „Disallow: /“, sind alle Crawler ausgesperrt, die nicht ausdrücklich zugelassen sind, auch die KI-Suche. Das ist die häufigste Ursache, wenn eine Praxis-Website in keiner KI-Antwort auftaucht.
Achtung
Die robots.txt ist nicht die einzige Stelle. Hoster, Sicherheits-Plugins und CDN-Dienste wie Cloudflare bieten eigene Schalter, um KI-Crawler zu sperren, und setzen manchmal eine eigene robots.txt vor Ihre. Genau das hatten wir auf unserer eigenen Website: Unsere Datei lief ins Leere, bis wir die Sperre beim CDN abgeschaltet haben.

Darf ich das Training verbieten?

Ja. Nach § 44b des Urheberrechtsgesetzes dürfen frei zugängliche Inhalte für Text und Data Mining genutzt werden, außer der Rechteinhaber hat sich das in maschinenlesbarer Form vorbehalten (§ 44b UrhG). Ein Eintrag in der robots.txt für die Trainings-Crawler ist der übliche Weg, diesen Vorbehalt zu erklären. Ob er rechtlich in jedem Fall genügt, ist noch nicht abschließend geklärt. Viele Website-Betreiber erklären ihn deshalb zusätzlich im Impressum.

Was ist die llms.txt?

llms.txt
Eine Textdatei im Hauptverzeichnis der Website, die Sprachmodellen in kurzer Form zeigt, was die Website anbietet und welche Seiten wichtig sind.

Die llms.txt ist ein Vorschlag aus dem Jahr 2024 (llmstxt.org) und kein verbindlicher Standard. Ob die großen KI-Anbieter sie auswerten, ist bisher nicht belegt. Wir pflegen auf med-direction.de trotzdem eine, mit unseren Leistungen und den Begriffen aus dem Glossar, und behandeln sie als Zugabe. Für eine Praxis gilt: Der Aufwand ist gering, der Nutzen offen. Erst kommen robots.txt und lesbare Seiten.

Lesbar ohne JavaScript

Nicht alle KI-Crawler führen JavaScript aus. Baut eine Website ihre Inhalte erst im Browser zusammen, sieht ein solcher Crawler eine fast leere Seite. Sicher ist, was der Server als fertiges HTML ausliefert. Wie eine Praxis-Website technisch aufgebaut sein sollte, beschreibt der Beitrag Website für Ärzte.

Selbsttest in fünf Minuten

Mini-Übung
1. Öffnen Sie www.ihre-praxis.de/robots.txt im Browser. 2. Suchen Sie nach OAI-SearchBot, PerplexityBot, Claude-SearchBot und nach der Zeile „User-agent: *“. Steht bei einem davon „Disallow: /“, ist er ausgesperrt. 3. Fragen Sie Ihren Webdienstleister, ob beim Hoster oder CDN eine KI-Bot-Sperre aktiv ist. 4. Fragen Sie ChatGPT nach Ihrer Praxis und schauen Sie, ob Ihre Website als Quelle erscheint.
  • Such-Crawler zugelassen? Sonst keine Nennung als Quelle möglich.
  • Keine Sperre beim Hoster oder CDN? Sonst läuft die robots.txt ins Leere.
  • Inhalte ohne JavaScript lesbar? Sonst sieht der Crawler eine leere Seite.

Nicht jede Praxis hat die Zeit oder die Nerven, sich durch Hoster-Menüs und CDN-Einstellungen zu klicken. Das müssen Sie auch nicht: Wir prüfen robots.txt, Sperren und Lesbarkeit Ihrer Seiten mit professionellen Werkzeugen und stellen alles so ein, dass es zu Ihrer Haltung passt.

Was die Einstellungen nicht leisten

Zugelassene Crawler sind eine Voraussetzung, keine Garantie. Ob eine Praxis in einer KI-Antwort genannt wird, hängt von den Inhalten, den Bewertungen und den Angaben auf anderen Seiten ab.

Die robots.txt ist eine Bitte, keine Sperre. Seriöse Anbieter halten sich daran, technisch erzwingen lässt sie sich nur über den Server oder das CDN.

Fazit und Ausblick

Ob eine Praxis in KI-Antworten als Quelle vorkommen kann, entscheidet sich zuerst an einer unscheinbaren Stelle: bei der Frage, wer die Website lesen darf. Für die meisten Praxen reichen drei Schritte:

  • Such-Crawler zulassen: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, PerplexityBot, Bingbot und Googlebot.
  • Sperren beim Hoster oder CDN prüfen: Sonst läuft die beste robots.txt ins Leere.
  • Inhalte als fertiges HTML ausliefern: damit auch Crawler ohne JavaScript alles lesen.

Ob Sie die Trainings-Crawler zulassen, ist eine Frage Ihrer Haltung, nicht Ihrer Sichtbarkeit. Die llms.txt ist eine Zugabe, kein Muss. Danach entscheiden Inhalte, Bewertungen und einheitliche Praxisdaten darüber, ob Ihre Praxis tatsächlich genannt wird. Soll es schneller gehen, übernehmen wir das als Teil unserer Leistung SEO und KI-Sichtbarkeit, von der Technik bis zur Frage, ob Ihre Praxis am Ende in den Antworten auftaucht.

Der Ausblick: Die Liste der Crawler wird länger, nicht kürzer. Neben Such- und Trainings-Crawlern kommen KI-Agenten hinzu, die im Auftrag von Patienten Praxen vergleichen und künftig auch Termine anfragen. Wer heute sauber festlegt, wer seine Website lesen darf, ist dafür vorbereitet. Prüfen Sie die robots.txt deshalb einmal im Halbjahr, denn die Anbieter benennen ihre Crawler gelegentlich um oder führen neue ein. Ob die llms.txt zum Standard wird, ist offen. Wir behalten das für unsere Kunden im Blick.

Mehrwert · Kurz erklärtSEO- und GEO-Trends 2026: Wie KI die Suche nach Praxen verändertWas sich durch KI-Suchen für Praxen insgesamt verändert und welche drei Schritte jetzt zählen:

Kommt Ihre Praxis in ChatGPT, Perplexity und der Google-KI vor? Wir prüfen es kostenlos.

KI-Sichtbarkeits-Check

Häufige Fragen

Soll ich GPTBot in der robots.txt sperren?

Das ist Ihre Entscheidung. GPTBot sammelt Material für das Training von OpenAI-Modellen. Für die Nennung in der ChatGPT-Suche ist ein anderer Crawler zuständig, OAI-SearchBot. Wer in ChatGPT vorkommen will, sollte mindestens OAI-SearchBot und ChatGPT-User zulassen.

Verschwinde ich aus den KI-Übersichten von Google, wenn ich Google-Extended sperre?

Nein. Google-Extended hat laut Google keinen Einfluss auf die Google-Suche und ist kein Rankingsignal. Es steuert aber, ob Inhalte für das Training von Gemini und für Antworten in der Gemini-App genutzt werden. Wer dort vorkommen will, lässt es zu.

Brauche ich eine llms.txt?

Sie schadet nicht und ist schnell angelegt, ihr Nutzen ist aber nicht belegt. Die llms.txt ist ein Vorschlag aus dem Jahr 2024 und kein verbindlicher Standard. Wichtiger sind eine robots.txt, die die Such-Crawler zulässt, und Seiten, die ohne JavaScript lesbar sind.

Wie oft sollte ich die robots.txt prüfen?

Einmal im Halbjahr und nach jeder größeren Änderung an der Website, beim Hoster oder beim CDN. Die KI-Anbieter benennen ihre Crawler gelegentlich um oder führen neue ein, und Updates von Plugins oder Hoster-Einstellungen können still eine Sperre aktivieren.

Kann MedDirection die Einstellungen für meine Praxis übernehmen?

Ja. Wir prüfen robots.txt, Sperren bei Hoster und CDN und die Lesbarkeit Ihrer Seiten mit professionellen Werkzeugen, stellen alles nach Ihrer Haltung zu Trainings-Crawlern ein und kontrollieren danach, ob Ihre Praxis in KI-Antworten als Quelle erscheint. Das ist Teil unserer Leistung SEO und KI-Sichtbarkeit.

Wo finde ich die robots.txt meiner Praxis-Website?

Unter Ihrer Domain mit dem Zusatz /robots.txt, zum Beispiel www.ihre-praxis.de/robots.txt. Steht dort bei einem der KI-Crawler „Disallow: /“, ist er ausgesperrt. Prüfen Sie zusätzlich die Einstellungen bei Ihrem Hoster oder Ihrem CDN, denn dort kann eine Sperre vorgeschaltet sein.

Zur Person

Frank Randel · CEO + IT-Architektur

Er entwirft mit Ihnen den Plan für Ihre Praxis und begleitet Sie, bis Design, Technik und Team zusammenpassen.

Schwerpunkte: Strategie · Konzept und Design · Technik

Zum Profil LinkedIn

Weiter im Thema