
KI-Crawler, robots.txt und llms.txt: Was Praxen einstellen sollten
Wer in ChatGPT, Perplexity oder Gemini als Quelle auftauchen will, muss deren Crawler auf die Website lassen. Viele Praxis-Websites sperren sie, ohne es zu wissen.
Von Frank Randel, CEO + IT-Architektur
· 5 min Lesezeit
Wer hier schreibt

Frank Randel
CEO + IT-Architektur
Er entwirft mit Ihnen den Plan für Ihre Praxis und begleitet Sie, bis Design, Technik und Team zusammenpassen.
- Fachartikel
- 11
- Leistungen verantwortet
- 6
ChatGPT, Perplexity, Gemini und Claude beantworten Patientenfragen mit Inhalten aus dem Netz. Dafür schicken die Anbieter Programme los, die Websites lesen: KI-Crawler. Welche davon Ihre Praxis-Website lesen dürfen, legt eine kleine Textdatei fest, die robots.txt. Steht dort das Falsche, kommt Ihre Praxis in KI-Antworten nicht als Quelle vor, egal wie gut die Inhalte sind.
In diesem Artikel zeigen wir, welche Crawler es gibt, welche eine Praxis zulassen sollte, wie die Einträge aussehen und was es mit der neuen llms.txt auf sich hat.
„Antwortsysteme herein, reine Sammler hinaus. Nach dieser Regel haben wir unsere eigene Website eingestellt.“
Frank Randel, CEO + IT-ArchitekturWas sind KI-Crawler?
- KI-Crawler
- Programme, mit denen Anbieter wie OpenAI, Anthropic, Perplexity oder Google Websites lesen. Ein Teil sammelt Material für das Training der Modelle, ein anderer holt Inhalte für Antworten in der KI-Suche.
Für Praxen ist diese Unterscheidung der Kern: Such-Crawler entscheiden darüber, ob Ihre Website in einer KI-Antwort als Quelle genannt werden kann. Trainings-Crawler sammeln Texte, aus denen künftige Modelle lernen. Den einen auszusperren, kostet Sichtbarkeit, den anderen auszusperren, ist eine Frage Ihrer Haltung.
| Crawler | Anbieter | Zweck | Empfehlung für Praxen |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Suchergebnisse in ChatGPT | zulassen |
| ChatGPT-User | OpenAI | ruft eine Seite ab, wenn jemand im Chat danach fragt | zulassen |
| GPTBot | OpenAI | Training der Modelle | Ihre Entscheidung |
| Claude-SearchBot | Anthropic | Suchergebnisse in Claude | zulassen |
| Claude-User | Anthropic | ruft eine Seite ab, wenn jemand in Claude danach fragt | zulassen |
| ClaudeBot | Anthropic | Training der Modelle | Ihre Entscheidung |
| PerplexityBot | Perplexity | Index für Antworten in Perplexity | zulassen |
| Perplexity-User | Perplexity | ruft eine Seite ab, wenn jemand danach fragt | zulassen |
| Google-Extended | Training von Gemini und Antworten in der Gemini-App, nicht die Google-Suche | zulassen, wenn Sie in Gemini vorkommen wollen | |
| Bingbot | Microsoft | Bing-Index, genutzt von Copilot und als Suchpartner von ChatGPT | zulassen |
Stand Oktober 2026, laut den Angaben von OpenAI, Anthropic, Perplexity und Google. Die Anbieter ändern ihre Crawler gelegentlich.
Wichtig für Google: Die KI-Übersichten in der Google-Suche entstehen aus dem normalen Google-Index. Google schreibt ausdrücklich, dass Google-Extended keinen Einfluss auf die Aufnahme in die Google-Suche hat (Google Search Central). Wer Googlebot zulässt, kann in den KI-Übersichten vorkommen.
So sieht die robots.txt aus
Die robots.txt liegt im Hauptverzeichnis Ihrer Website. Jeder Block nennt einen Crawler und sagt, was er darf. Für eine Praxis, die in KI-Antworten vorkommen will, reichen wenige Zeilen:
| Eintrag | Bedeutung |
|---|---|
| User-agent: OAI-SearchBot · Allow: / | ChatGPT-Suche darf die ganze Website lesen |
| User-agent: Claude-SearchBot · Allow: / | Claude-Suche darf die ganze Website lesen |
| User-agent: PerplexityBot · Allow: / | Perplexity darf die ganze Website lesen |
| User-agent: GPTBot · Disallow: / | Beispiel: OpenAI darf die Website nicht für das Training nutzen |
| User-agent: * · Allow: / | alle anderen Crawler dürfen lesen |
Quick-Tipp
Achtung
Darf ich das Training verbieten?
Ja. Nach § 44b des Urheberrechtsgesetzes dürfen frei zugängliche Inhalte für Text und Data Mining genutzt werden, außer der Rechteinhaber hat sich das in maschinenlesbarer Form vorbehalten (§ 44b UrhG). Ein Eintrag in der robots.txt für die Trainings-Crawler ist der übliche Weg, diesen Vorbehalt zu erklären. Ob er rechtlich in jedem Fall genügt, ist noch nicht abschließend geklärt. Viele Website-Betreiber erklären ihn deshalb zusätzlich im Impressum.
Was ist die llms.txt?
- llms.txt
- Eine Textdatei im Hauptverzeichnis der Website, die Sprachmodellen in kurzer Form zeigt, was die Website anbietet und welche Seiten wichtig sind.
Die llms.txt ist ein Vorschlag aus dem Jahr 2024 (llmstxt.org) und kein verbindlicher Standard. Ob die großen KI-Anbieter sie auswerten, ist bisher nicht belegt. Wir pflegen auf med-direction.de trotzdem eine, mit unseren Leistungen und den Begriffen aus dem Glossar, und behandeln sie als Zugabe. Für eine Praxis gilt: Der Aufwand ist gering, der Nutzen offen. Erst kommen robots.txt und lesbare Seiten.
Lesbar ohne JavaScript
Nicht alle KI-Crawler führen JavaScript aus. Baut eine Website ihre Inhalte erst im Browser zusammen, sieht ein solcher Crawler eine fast leere Seite. Sicher ist, was der Server als fertiges HTML ausliefert. Wie eine Praxis-Website technisch aufgebaut sein sollte, beschreibt der Beitrag Website für Ärzte.
Selbsttest in fünf Minuten
Mini-Übung
- Such-Crawler zugelassen? Sonst keine Nennung als Quelle möglich.
- Keine Sperre beim Hoster oder CDN? Sonst läuft die robots.txt ins Leere.
- Inhalte ohne JavaScript lesbar? Sonst sieht der Crawler eine leere Seite.
Nicht jede Praxis hat die Zeit oder die Nerven, sich durch Hoster-Menüs und CDN-Einstellungen zu klicken. Das müssen Sie auch nicht: Wir prüfen robots.txt, Sperren und Lesbarkeit Ihrer Seiten mit professionellen Werkzeugen und stellen alles so ein, dass es zu Ihrer Haltung passt.
Was die Einstellungen nicht leisten
Zugelassene Crawler sind eine Voraussetzung, keine Garantie. Ob eine Praxis in einer KI-Antwort genannt wird, hängt von den Inhalten, den Bewertungen und den Angaben auf anderen Seiten ab.
Die robots.txt ist eine Bitte, keine Sperre. Seriöse Anbieter halten sich daran, technisch erzwingen lässt sie sich nur über den Server oder das CDN.
Fazit und Ausblick
Ob eine Praxis in KI-Antworten als Quelle vorkommen kann, entscheidet sich zuerst an einer unscheinbaren Stelle: bei der Frage, wer die Website lesen darf. Für die meisten Praxen reichen drei Schritte:
- Such-Crawler zulassen: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, PerplexityBot, Bingbot und Googlebot.
- Sperren beim Hoster oder CDN prüfen: Sonst läuft die beste robots.txt ins Leere.
- Inhalte als fertiges HTML ausliefern: damit auch Crawler ohne JavaScript alles lesen.
Ob Sie die Trainings-Crawler zulassen, ist eine Frage Ihrer Haltung, nicht Ihrer Sichtbarkeit. Die llms.txt ist eine Zugabe, kein Muss. Danach entscheiden Inhalte, Bewertungen und einheitliche Praxisdaten darüber, ob Ihre Praxis tatsächlich genannt wird. Soll es schneller gehen, übernehmen wir das als Teil unserer Leistung SEO und KI-Sichtbarkeit, von der Technik bis zur Frage, ob Ihre Praxis am Ende in den Antworten auftaucht.
Der Ausblick: Die Liste der Crawler wird länger, nicht kürzer. Neben Such- und Trainings-Crawlern kommen KI-Agenten hinzu, die im Auftrag von Patienten Praxen vergleichen und künftig auch Termine anfragen. Wer heute sauber festlegt, wer seine Website lesen darf, ist dafür vorbereitet. Prüfen Sie die robots.txt deshalb einmal im Halbjahr, denn die Anbieter benennen ihre Crawler gelegentlich um oder führen neue ein. Ob die llms.txt zum Standard wird, ist offen. Wir behalten das für unsere Kunden im Blick.
Mehrwert · Kurz erklärtSEO- und GEO-Trends 2026: Wie KI die Suche nach Praxen verändertWas sich durch KI-Suchen für Praxen insgesamt verändert und welche drei Schritte jetzt zählen:Kommt Ihre Praxis in ChatGPT, Perplexity und der Google-KI vor? Wir prüfen es kostenlos.
KI-Sichtbarkeits-CheckHäufige Fragen
Soll ich GPTBot in der robots.txt sperren?
Das ist Ihre Entscheidung. GPTBot sammelt Material für das Training von OpenAI-Modellen. Für die Nennung in der ChatGPT-Suche ist ein anderer Crawler zuständig, OAI-SearchBot. Wer in ChatGPT vorkommen will, sollte mindestens OAI-SearchBot und ChatGPT-User zulassen.
Verschwinde ich aus den KI-Übersichten von Google, wenn ich Google-Extended sperre?
Nein. Google-Extended hat laut Google keinen Einfluss auf die Google-Suche und ist kein Rankingsignal. Es steuert aber, ob Inhalte für das Training von Gemini und für Antworten in der Gemini-App genutzt werden. Wer dort vorkommen will, lässt es zu.
Brauche ich eine llms.txt?
Sie schadet nicht und ist schnell angelegt, ihr Nutzen ist aber nicht belegt. Die llms.txt ist ein Vorschlag aus dem Jahr 2024 und kein verbindlicher Standard. Wichtiger sind eine robots.txt, die die Such-Crawler zulässt, und Seiten, die ohne JavaScript lesbar sind.
Wie oft sollte ich die robots.txt prüfen?
Einmal im Halbjahr und nach jeder größeren Änderung an der Website, beim Hoster oder beim CDN. Die KI-Anbieter benennen ihre Crawler gelegentlich um oder führen neue ein, und Updates von Plugins oder Hoster-Einstellungen können still eine Sperre aktivieren.
Kann MedDirection die Einstellungen für meine Praxis übernehmen?
Ja. Wir prüfen robots.txt, Sperren bei Hoster und CDN und die Lesbarkeit Ihrer Seiten mit professionellen Werkzeugen, stellen alles nach Ihrer Haltung zu Trainings-Crawlern ein und kontrollieren danach, ob Ihre Praxis in KI-Antworten als Quelle erscheint. Das ist Teil unserer Leistung SEO und KI-Sichtbarkeit.
Wo finde ich die robots.txt meiner Praxis-Website?
Unter Ihrer Domain mit dem Zusatz /robots.txt, zum Beispiel www.ihre-praxis.de/robots.txt. Steht dort bei einem der KI-Crawler „Disallow: /“, ist er ausgesperrt. Prüfen Sie zusätzlich die Einstellungen bei Ihrem Hoster oder Ihrem CDN, denn dort kann eine Sperre vorgeschaltet sein.
Zur Person

Frank Randel · CEO + IT-Architektur
Er entwirft mit Ihnen den Plan für Ihre Praxis und begleitet Sie, bis Design, Technik und Team zusammenpassen.
Schwerpunkte: Strategie · Konzept und Design · Technik