Ako pripraviť web pre AI vyhľadávanie
Zákazník sa čoraz častejšie pýta ChatGPT alebo Perplexity namiesto Googlu. Ukazujeme na vlastnom webe, čo treba nastaviť, aby vás tieto nástroje vôbec mohli prečítať a odcitovať: robots.txt, llms.txt a štruktúrované dáta.
Keď sa dnes niekto pýta na dodávateľa webu, nemusí skončiť vo výsledkoch Googlu. Otázku napíše do ChatGPT, Perplexity alebo si prečíta prehľad od Google AI. Odpoveď v týchto nástrojoch stojí na tom, čo si o vás roboty stihli prečítať, a či im to vaša stránka vôbec dovolila. Na vlastnom webe sme si to nastavili od začiatku a tu je presne to, čo sme urobili.
robots.txt: povoľte tie roboty, ktoré vás majú citovať
Väčšina webov má v súbore robots.txt jediný blok pre všetkých robotov. Problém je, že AI nástroje chodia pod vlastnými menami a niektoré weby ich plošne blokujú, často bez toho, aby o tom majiteľ vedel. Náš robots.txt má dnes 15 samostatných blokov a menovite púšťa okrem Googlebota a Bingbota aj GPTBot a OAI-SearchBot od OpenAI, ChatGPT-User, ClaudeBot, anthropic-ai a Claude-Web od Anthropicu, PerplexityBot a Perplexity-User, Google-Extended, Applebot aj Applebot-Extended a CCBot. Zakázaná je len administrácia a JSON API, teda časti, ktoré aj tak nemajú čo hľadať vo výsledkoch.
Rozhodnutie, ktoré roboty pustiť, je obchodné, nie technické. Kto nechce, aby jeho texty skončili v tréningových dátach, môže Google-Extended alebo CCBot pokojne zakázať a vyhľadávacie roboty nechať. My sme sa rozhodli opačne: chceme, aby nás asistent vedel odporučiť, keď sa ho niekto opýta na webovú agentúru v Bratislave.
llms.txt: firma zhrnutá na jednej stránke
Jazykový model si pri odpovedi nestiahne celý web. Prečíta pár stránok a z nich poskladá odpoveď, takže mu treba dať jedno miesto, kde sú tvrdé fakty pokope. Presne na to slúži súbor llms.txt, textový prehľad v koreni domény.
Ten náš má niečo cez päť kilobajtov a začína odsekom s faktami, na ktorých záleží: kto sme, kde sídlime, aké je IČO, koľko rokov a projektov máme za sebou, na čom weby staviame, koľko stojí prezentačný a firemný web, že nie sme platiteľmi DPH, telefón a e-mail. Pod tým je šesť sekcií, Služby, Produkty, Referencie, Blog, Kontakt a anglické zhrnutie, každá s absolútnymi odkazmi a jednou vetou vysvetlenia. Keď sa asistenta niekto opýta na cenu webu, nemusí ju hádať z marketingových fráz, číta ju z jedného riadku.
Štruktúrované dáta a jedinečné titulky
Roboty aj vyhľadávače potrebujú vedieť, čo je čo. Na každej stránke preto posielame štruktúrované dáta v JSON-LD: firemný záznam s adresou, IČO, kontaktom a profilmi na sociálnych sieťach, záznam o webe, na podstránkach služieb typ Service s cenou, drobčekovú navigáciu a na stránkach s otázkami aj blok FAQ. To isté, čo číta Google pri rozšírených výsledkoch, používajú aj jazykové modely, keď si overujú fakty.
Druhá vec, ktorá sa podceňuje, je titulok a popis. Kým sme to neprešli, desiatky referenčných podstránok zdieľali jeden a ten istý popis z hlavnej šablóny. Dnes má každá zo 116 adries v sitemape vlastný titulok aj popis a sitemap nesie skutočný dátum poslednej zmeny, nie dnešný dátum vygenerovaný pri každom načítaní.
Ako si to overiť
Nič z toho nie je vidieť na stránke, takže si to treba overiť priamo. Otvorte si vasadomena.sk/robots.txt a pozrite, či tam nie je riadok, ktorý blokuje GPTBot alebo Google-Extended. Skúste vasadomena.sk/llms.txt, väčšinou vráti chybu 404. Vložte adresu do testu štruktúrovaných údajov od Googlu a pozrite, čo z nej vyčíta. A v Search Console si otvorte report Stránky: ak tam máte desiatky adries v stave nezaindexované, žiadne nastavenie pre AI vám nepomôže, kým sa nevyriešia.
Ak chcete, aby sme sa na váš web pozreli, napíšte nám cez kontaktný formulár, odpovieme do 24 hodín s tým, čo konkrétne treba doplniť.