Zpět na blog
6 min čtení

Jak ChatGPT indexuje vaše stránky

Dnešní doba se rychle mění a s ní i nároky na SEO. Dneska už nezáleží jen na tom, jestli je vaše stránka dobře zaindexovaná v Googlu. S příchodem ChatGPT, Claude a dalších AI modelů lidé už nehledají pouze přes Google — ptají se rovnou AI. Jak ale zařídím, aby ChatGPT vyhodil stránku mého byznysu, když se na něj uživatelé zeptají? Dneska si o tom povíme něco víc.

Existuje několik metod, jak dostat vaše stránky do ChatGPT:

  • Indexing Prompts
  • ChatGPT Crawlers
  • llms.txt

Indexing Prompts

Touto metodou se snažím dostat do ChatGPT zmínku, že můj web vůbec existuje. Můžu mu položit přímo dotaz, ať doménu mé stránky najde — a jakmile s mojí doménou jednou začne vyhledávat přes své search nástroje, ChatGPT si ji uloží do takzvaného knowledge graphu, neboli databáze znalostí. Příště už tedy o vaší stránce „ví“ a může ji nabídnout dalším uživatelům.

ChatGPT Crawlers

K natrénování ChatGPT se využily texty z celého internetu. Aby platforma tato textová data získala, používá takzvané webcrawlery. Stejnou metodu používají i vyhledávače typu Google, Bing nebo Seznam.cz. Aby si ChatGPT zapamatoval naši stránku, můžeme konkrétním crawlerům od OpenAI povolit, aby ji prohledali. Tato povolení se vždy definují v souboru robots.txt.

Soubor robots.txt leží v kořeni domény (např. https://vasedomena.cz/robots.txt) a má jednoduchou strukturu — pro každého robota (User-agent) určíte, co smí (Allow) a co ne (Disallow), a na konci odkážete na mapu webu (Sitemap):

# OpenAI / ChatGPT
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

# Bing (vyhledávač v pozadí ChatGPT)
User-agent: bingbot
Allow: /

Sitemap: https://vasedomena.cz/sitemap.xml

Jednotliví roboti mají různý účel: GPTBot sbírá data pro trénink, OAI-SearchBot a ChatGPT-User obstarávají vyhledávání a prohlížení stránek během odpovědi. Více o crawlerech od OpenAI se dočtete v jejich dokumentaci: developers.openai.com/api/docs/bots.

Další věc je, že ChatGPT v pozadí využívá vyhledávací nástroje. Protože je OpenAI úzce spojená s Microsoftem, používá k tomu nic jiného než vyhledávač Bing. Proto bychom měli v souboru robots.txt povolit i to, aby naši stránku procházel crawler Bingu (bingbot) — jak ukazuje příklad výše.

llms.txt

llms.txt je nově navrhovaný standard, který pomáhá ChatGPT a dalším AI modelům lépe pochopit, co se na vaší stránce nachází. Zahrnete do něj strukturu webu, jeho obsah a stručně popíšete, o čem stránka je. Jde o jakousi „čtečku na míru“ pro jazykové modely — místo aby se prokousávaly celým HTML, dostanou přehlednou mapu toho nejdůležitějšího.

Soubor se ukládá do kořene domény (https://vasedomena.cz/llms.txt) a píše se v Markdownu. Struktura je jednoduchá — nadpis s názvem webu, krátký popis, a pak odkazy roztříděné do sekcí:

# Název webu

> Jednou větou, čím se web zabývá a komu je určen.

## Hlavní stránky

- [Domů](https://vasedomena.cz/): Stručný popis stránky
- [Služby](https://vasedomena.cz/sluzby): Co nabízíte
- [O nás](https://vasedomena.cz/o-nas): Kdo za webem stojí

## Blog

- [Název článku](https://vasedomena.cz/blog/clanek): O čem článek je

## Kontakt

- [Kontakt](https://vasedomena.cz/kontakt): Jak vás oslovit

Výše uvedené je jen ukázka struktury — obsah si pochopitelně přizpůsobíte svému webu. Důležité je, aby každý odkaz měl krátký a výstižný popis, podle kterého model pozná, co na dané stránce najde.

Kontakt

Ozvěte se nám.

Popište nám váš projekt — ozveme se s návrhem postupu a cenovým odhadem.

Nebo nám napište přímo

martin.studna@craftologylabs.com

Nebo nám zavolejte

+420 775 058 619

Sledujte nás

@tldr.web

Martin Studna · Craftology Labs s.r.o.