Generator in preverjanje llms.txt: da vas iskalniki UI pravilno opišejo
llms.txt je kratka datoteka Markdown na naslovu /llms.txt, ki jezikovnemu modelu pove, kdo ste in katere strani so pomembne.
Napišete jo v približno eni uri. Ne zagotavlja, da vas bodo ChatGPT, Perplexity ali Gemini navajali,
Google pa piše, da je njegove funkcije UI ne potrebujejo. Pomaga agentom in orodjem, ki jo berejo, in vas prisili,
da v dveh stavkih poveste, kaj delate. Pri optimizaciji za velike jezikovne modele je to najcenejši korak. Spodaj jo lahko ustvarite ali preverite obstoječo.
Generator in preverjanje potrebujeta JavaScript. Oblika je opisana spodaj; pišite na info@mediaatlas.si in datoteko pogledamo skupaj.
Vpišite, kar naj model ve o vas
Ena povezava na vrstico, v obliki Ime | URL | kratek opis. Poti, kot je /about.html, postanejo polni naslovi z vaše spletne strani. Datoteka se sproti posodablja. Nič se ne pošlje.
Datoteko naložite v koren spletne strani, da se odpre na https://vasa-domena/llms.txt.
Prilepite svoj llms.txt in poglejte, kaj je narobe
Preveri zgradbo (H1 v prvi vrstici, povzetek, razdelki ##), obliko vsake povezave, ostanke predlog in dolžino. Povezav ne odpre, zato ne ve, ali stran obstaja.
Napake pokvarijo obliko ali vodijo nikamor. Opozorila so mesta, ki jih bo model verjetno narobe prebral. Opombe so naše želje, ne specifikacija. Meje za dolžino povzetka in datoteke so naše pravilo na pamet.
Kaj spada v llms.txt?
Obliko je septembra 2024 predlagal Jeremy Howard, opisana je na llmstxt.org (različica 2, avgust 2026). Po vrsti:
- Naslov H1 z imenom. Edini obvezni del.
- Citat s kratkim povzetkom.
- Neobvezno besedilo brez naslovov: odstavki ali seznami s tem, kar model potrebuje, da prav prebere ostalo.
- Razdelki ## s seznami povezav:
- [ime](url): opis. Razdelek z imenomOptionalje po dogovoru za povezave, ki jih agent lahko izpusti, ko mu zmanjka prostora.
Datoteka je v korenu strani, /llms.txt. Različica 2 predlaga še kopijo vsake pomembne strani v Markdownu (stran.html.md ali stran.md) in povezavo rel="describedby", ki kaže na datoteko. To so dodatki; večina malih podjetij dobi glavno korist že od same datoteke.
Kaj preverjanje išče
- Zgradba: H1 v prvi vrstici, samo en H1, povzetek takoj za njim, brez naslovov ###, vsaj en razdelek ## s povezavami, brez praznih razdelkov, Optional na koncu.
- Mrtve oblike povezav: prazne povezave,
#injavascript:, relativne poti brez domene, povezave na localhost, testne strežnike ali staging, example.com iz predloge, presledki v naslovih, nezaprti oklepaji, goli naslovi brez oblike[ime](url). - Ostanki: neizpolnjeni žetoni predlog in oznake HTML. Oboje se zgodi, ko datoteko ustvari gradnja ali vtičnik v CMS in rezultata nihče ne prebere.
- Dolžina: znaki, besede in približno število žetonov. Nad 50.000 znaki predlagamo, da podrobnosti prestavite v drugo datoteko in nanjo povežete.
Česa ne zna: odpreti povezav. Ali stran vrne 404, preverite v brskalniku ali s pajkom. Tako nič ne zapusti vašega računalnika.
Naš llms.txt z opombami
To je začetek naše datoteke, ponekod skrajšan. Napisana je v angleščini, ker jo berejo modeli po vsem svetu, slovenske strani pa so povezane v isti vrstici:
# MediaAtlas > MediaAtlas d.o.o. (Sevnica, Slovenia, founded 2012) is an AI research and development studio. It trains language models on a company's own data and deploys them inside the company's infrastructure, weights included. […] Full technical detail: https://mediaatlas.si/llms-full.txt . […] ## Flagship service: LLM fine-tuning and AI model training - [Pricing (EN)](https://mediaatlas.si/ai-training-pricing.html) / [Cenik (SL)](https://mediaatlas.si/sl/ai-training-pricing.html): public price list. One-day evaluation on the customer's own documents EUR 1,900 (credited against a pilot); […] EUR, excluding VAT. […] - [What is MediaAtlas?](https://mediaatlas.si/#what-is-mediaatlas) / [SL](https://mediaatlas.si/sl/#kaj-je-mediaatlas): […] not connected to companies called Atlas Media; motion capture is earlier work. […]
Zakaj je napisana tako:
- Povzetek odgovori, kdo, kaj, kje in od kdaj. Malo podjetje je lahko zamenjati s kom drugim. Naše ime je blizu podjetjem z imenom Atlas Media, zato datoteka naravnost pove, da z njimi nismo povezani in da je zajem gibanja naše starejše delo, ne to, kar delamo danes.
- Cene so izpisane, z valuto in DDV. »Za ceno nas kontaktirajte« pusti modelu, da ugiba, in ugibal bo. Zneski se ujemajo z našim cenikom; ob vsaki spremembi cene preverite, da se ujemata.
- Vsaka povezava je poln naslov https na resnično stran HTML. Angleška in slovenska različica sta v isti vrstici, da model vidi, da gre za isto stran.
- Podrobnosti so v drugi datoteki. Povzetek poveže na llms-full.txt s tehničnim ozadjem. Glavna datoteka ostane dovolj kratka, da jo agent prebere v enem kosu.
Česa llms.txt ne naredi
- Ni zagotovilo za navajanje. Noben iskalnik UI ni obljubil, da bo povzel, kar piše v datoteki.
- Google pravi, da ni potrebna. V dokumentaciji o funkcijah UI v iskanju piše: »You don't need to create new machine readable files, AI text files, or markup to appear in these features.« (Google Search Central). Tam štejejo stran, ki jo je mogoče indeksirati, jasno besedilo in strukturirani podatki, ki se ujemajo z vidno vsebino.
- Lighthouse preveri le, da datoteka ne pade. Chromov Lighthouse ima pregled llms.txt, a ta pade samo ob napaki strežnika; manjkajoča datoteka je označena z N/A, ker je za zdaj neobvezna (Chrome for Developers).
- Ne popravi napačnih strani. Če cenik pravi eno, datoteka pa drugo, ste zmedo samo povečali. Datoteka povzema vaše strani, ne nadomešča jih.
Kje pomaga: agentom in programerskim asistentom, ki datoteko iščejo, in vsakomur, ki gradi na vaši dokumentaciji. Po navedbah llmstxt.org laboratoriji UI objavljajo llms.txt za svojo razvijalsko dokumentacijo. In samo pisanje: podjetja, ki polja s povzetkom ne zna izpolniti v dveh stavkih, nihče ne bo dobro opisal.
Kdaj nas ne potrebujete
Za llms.txt skoraj nikoli. Zgornji obrazec in ura časa zadoščata, datoteka pa ne stane nič. Ko se spremenijo storitve ali cene, jo napišite na novo in jo tu še enkrat preverite.
Težje postane, ko ima stran desetine strani, cene na več mestih in dva jezika, vsaka sprememba pa mora priti povsod hkrati. To je delo, ki ga na naših straneh opravlja naš agent za vsebine; kako deluje, je na strani Agenti UI. Izdelava takega agenta za vašo stran je pilot agenta, od 6.900 € (4–6 tednov), brez DDV.
Pogosta vprašanja
Kaj je llms.txt?
Datoteka Markdown v korenu spletne strani (/llms.txt), ki jezikovnemu modelu v nekaj vrsticah pove, kdo ste, in poveže na vaše najpomembnejše strani. Predlagal jo je Jeremy Howard septembra 2024, oblika je opisana na llmstxt.org.
Me bodo ChatGPT, Perplexity ali Gemini navajali, če dodam llms.txt?
Zagotovila ni. Google piše, da njegove funkcije UI v iskanju ne potrebujejo posebnih datotek za UI. Datoteka pomaga agentom in orodjem, ki jo berejo, navedbe pa so še vedno odvisne od samih strani.
Kaj mora vsebovati llms.txt?
Obvezen je samo naslov H1 z vašim imenom. V praksi dodajte povzetek v enem do treh stavkih kot citat, nato razdelke ## s seznami povezav v obliki - [ime](url): opis.
Ali preverjanje odpre moje povezave?
Ne. Preveri obliko vsake povezave (poln naslov https, brez lokalnih ali predložnih naslovov, brez praznih povezav ali #), ne pa, ali stran obstaja. Nič ne zapusti vašega brskalnika.
Ali se kar vpišem kje shrani ali pošlje?
Ne. Generator in preverjanje tečeta v celoti v vašem brskalniku, brez piškotkov. Nič se ne shrani in nič se ne pošlje.
Najprej dva stavka, potem datoteka.
Če sta ta dva stavka težka, je to koristna ugotovitev. Vaš osnutek z veseljem preberemo in povemo, kaj bi model verjetno narobe razumel.