Blog
Späť na blog

Ako pripraviť web pre AI vyhľadávanie

Zákazník sa čoraz častejšie pýta ChatGPT alebo Perplexity namiesto Googlu. Ukazujeme na vlastnom webe, čo treba nastaviť, aby vás tieto nástroje vôbec mohli prečítať a odcitovať: robots.txt, llms.txt a štruktúrované dáta.

Ako pripraviť web pre AI vyhľadávanie

Keď sa dnes niekto pýta na dodávateľa webu, nemusí skončiť vo výsledkoch Googlu. Otázku napíše do ChatGPT, Perplexity alebo si prečíta prehľad od Google AI. Odpoveď v týchto nástrojoch stojí na tom, čo si o vás roboty stihli prečítať, a či im to vaša stránka vôbec dovolila. Na vlastnom webe sme si to nastavili od začiatku a tu je presne to, čo sme urobili.

robots.txt: povoľte tie roboty, ktoré vás majú citovať

Väčšina webov má v súbore robots.txt jediný blok pre všetkých robotov. Problém je, že AI nástroje chodia pod vlastnými menami a niektoré weby ich plošne blokujú, často bez toho, aby o tom majiteľ vedel. Náš robots.txt má dnes 15 samostatných blokov a menovite púšťa okrem Googlebota a Bingbota aj GPTBot a OAI-SearchBot od OpenAI, ChatGPT-User, ClaudeBot, anthropic-ai a Claude-Web od Anthropicu, PerplexityBot a Perplexity-User, Google-Extended, Applebot aj Applebot-Extended a CCBot. Zakázaná je len administrácia a JSON API, teda časti, ktoré aj tak nemajú čo hľadať vo výsledkoch.

Rozhodnutie, ktoré roboty pustiť, je obchodné, nie technické. Kto nechce, aby jeho texty skončili v tréningových dátach, môže Google-Extended alebo CCBot pokojne zakázať a vyhľadávacie roboty nechať. My sme sa rozhodli opačne: chceme, aby nás asistent vedel odporučiť, keď sa ho niekto opýta na webovú agentúru v Bratislave.

llms.txt: firma zhrnutá na jednej stránke

Jazykový model si pri odpovedi nestiahne celý web. Prečíta pár stránok a z nich poskladá odpoveď, takže mu treba dať jedno miesto, kde sú tvrdé fakty pokope. Presne na to slúži súbor llms.txt, textový prehľad v koreni domény.

Ten náš má niečo cez päť kilobajtov a začína odsekom s faktami, na ktorých záleží: kto sme, kde sídlime, aké je IČO, koľko rokov a projektov máme za sebou, na čom weby staviame, koľko stojí prezentačný a firemný web, že nie sme platiteľmi DPH, telefón a e-mail. Pod tým je šesť sekcií, Služby, Produkty, Referencie, Blog, Kontakt a anglické zhrnutie, každá s absolútnymi odkazmi a jednou vetou vysvetlenia. Keď sa asistenta niekto opýta na cenu webu, nemusí ju hádať z marketingových fráz, číta ju z jedného riadku.

Štruktúrované dáta a jedinečné titulky

Roboty aj vyhľadávače potrebujú vedieť, čo je čo. Na každej stránke preto posielame štruktúrované dáta v JSON-LD: firemný záznam s adresou, IČO, kontaktom a profilmi na sociálnych sieťach, záznam o webe, na podstránkach služieb typ Service s cenou, drobčekovú navigáciu a na stránkach s otázkami aj blok FAQ. To isté, čo číta Google pri rozšírených výsledkoch, používajú aj jazykové modely, keď si overujú fakty.

Druhá vec, ktorá sa podceňuje, je titulok a popis. Kým sme to neprešli, desiatky referenčných podstránok zdieľali jeden a ten istý popis z hlavnej šablóny. Dnes má každá zo 116 adries v sitemape vlastný titulok aj popis a sitemap nesie skutočný dátum poslednej zmeny, nie dnešný dátum vygenerovaný pri každom načítaní.

Ako si to overiť

Nič z toho nie je vidieť na stránke, takže si to treba overiť priamo. Otvorte si vasadomena.sk/robots.txt a pozrite, či tam nie je riadok, ktorý blokuje GPTBot alebo Google-Extended. Skúste vasadomena.sk/llms.txt, väčšinou vráti chybu 404. Vložte adresu do testu štruktúrovaných údajov od Googlu a pozrite, čo z nej vyčíta. A v Search Console si otvorte report Stránky: ak tam máte desiatky adries v stave nezaindexované, žiadne nastavenie pre AI vám nepomôže, kým sa nevyriešia.

Ak chcete, aby sme sa na váš web pozreli, napíšte nám cez kontaktný formulár, odpovieme do 24 hodín s tým, čo konkrétne treba doplniť.