• llms.txt: cos’è e come impostarlo per la visibilità AI

    llms.txt: cos’è e come impostarlo per la visibilità AI

    llms.txt è un file di testo in formato markdown, posizionato nella root del dominio, che fornisce agli agenti AI un indice curato e sintetico dei contenuti più importanti del sito, così che possano capirlo e citarlo in modo più accurato senza dover elaborare l’intero HTML della pagina. Non è un obbligo tecnico né uno standard riconosciuto ufficialmente da Google o dai provider AI, ma un file che i principali crawler AI stanno iniziando a leggere quando è presente, e la sua adozione sta crescendo rapidamente tra i siti che vogliono ottimizzare la propria citabilità.

    Va chiarita subito la differenza con robots.txt, di cui abbiamo già parlato in un articolo dedicato ai bot AI: robots.txt dice ai crawler cosa possono e non possono leggere, è un file di permessi. llms.txt non gestisce permessi, è un indice contenutistico che dice ai modelli linguistici quali pagine sono più rilevanti e come sono organizzate, in un formato che un modello legge molto più velocemente di quanto impieghi a interpretare l’HTML completo di ogni pagina del sito.

    A cosa serve davvero llms.txt

    Un modello linguistico che deve rispondere a una domanda su un argomento specifico ha bisogno di recuperare informazioni pertinenti in tempo reale, un processo che nel gergo tecnico si chiama retrieval. Più il contenuto è facile da estrarre e interpretare correttamente, più aumentano le probabilità che il sito venga citato nella risposta finale.

    L’HTML di una pagina web moderna è pensato per essere reso visivamente da un browser: contiene markup di layout, script, elementi di navigazione ripetuti su ogni pagina, tutto materiale che per un modello linguistico è rumore rispetto al contenuto informativo vero e proprio. llms.txt elimina questo rumore fornendo direttamente, in formato markdown pulito, una mappa dei contenuti principali del sito con link diretti alle pagine più rilevanti, organizzate per argomento.

    Il file non sostituisce la sitemap XML, che resta lo strumento principale per l’indicizzazione di Google. È un livello complementare pensato specificamente per l’ecosistema AI, con un formato ottimizzato per essere letto da un modello linguistico invece che da un motore di scansione tradizionale.

    La struttura di un file llms.txt

    Il formato è markdown semplice, con una struttura convenzionale che si sta consolidando tra i siti che lo adottano: un titolo H1 con il nome del sito, un breve paragrafo di descrizione, e una serie di sezioni H2 che raggruppano i link alle pagine principali per categoria.

    # Blurr
    
    > Blurr è uno studio WordPress white label con sede a Calliano (Trento), attivo dal 2008. Sviluppiamo siti WordPress per agenzie web, freelancer e studi di comunicazione italiani, senza mai avere contatto diretto con i clienti finali.
    
    ## Servizi
    
    - [Servizi per agenzie](https://blurr.it/servizi/): sviluppo WordPress white label, manutenzione, ecommerce
    - [Come funziona la collaborazione](https://blurr.it/sviluppo-siti-wordpress-agenzie-come-funziona-blurr/): processo dalla richiesta alla consegna
    
    ## Guide White Label e Outsourcing
    
    - [Cos'è il white label nel web design](https://blurr.it/cose-il-white-label-nel-web-design-e-perche-sempre-piu-agenzie-lo-usano/)
    - [White label vs sviluppatore interno](https://blurr.it/white-label-vs-sviluppatore-interno/)
    
    ## Guide tecniche WordPress
    
    - [Checklist performance WordPress](https://blurr.it/wordpress-performance-elevate-checklist-agenzie/)
    - [Sicurezza WordPress](https://blurr.it/sicurezza-wordpress-gestione-accessi-utenti/)
    
    ## Chi siamo
    
    - [Chi siamo](https://blurr.it/chi-siamo/)
    - [Contatti](https://blurr.it/contatti/)

    Questo è un esempio semplificato: un sito con centinaia di articoli, come un blog editoriale strutturato in cluster tematici, dovrebbe raggruppare i link per categoria seguendo la stessa logica della tassonomia già usata sul sito, mantenendo il file leggibile e non semplicemente un elenco piatto di tutti i contenuti pubblicati.

    Come crearlo su WordPress

    Su WordPress il file va posizionato nella root pubblica del sito, raggiungibile all’indirizzo tuodominio.it/llms.txt, esattamente come robots.txt e sitemap.xml. Le opzioni tecniche per generarlo sono due.

    Generazione manuale statica. Per siti con una struttura di contenuti stabile, che non cambia con frequenza elevata, un file statico caricato via FTP o tramite il file manager dell’hosting è la soluzione più semplice. Va aggiornato manualmente quando si pubblicano nuovi contenuti rilevanti o quando cambia la struttura delle categorie principali.

    Generazione dinamica tramite funzione WordPress. Per blog con pubblicazione frequente, ha senso generare il file dinamicamente con una funzione che intercetta la richiesta a /llms.txt e costruisce il contenuto a partire dai post e dalle categorie esistenti nel database. Questo approccio richiede uno sviluppo custom, ma mantiene il file sempre aggiornato senza intervento manuale ad ogni nuova pubblicazione.

    Problema: llms.txt statico che invecchia rapidamente su blog con pubblicazione frequente
    Causa: il file viene creato una volta e non aggiornato ai nuovi articoli pubblicati
    Soluzione Blurr: hook su WordPress che rigenera il file in automatico ad ogni pubblicazione o aggiornamento di un post, mantenendo l'indice sempre sincronizzato con i contenuti reali del sito

    Cosa includere e cosa escludere

    Il valore di llms.txt sta nella selezione, non nella completezza. Un file che elenca tutte le duecento pagine di un sito senza gerarchia non aiuta un modello più di quanto farebbe la sitemap XML già esistente. La logica corretta è curatoriale: includere le pagine pillar di ogni cluster tematico, le pagine di servizio principali, i contenuti con il maggior valore informativo verificato.

    Vanno esclusi contenuti duplicati, pagine di categoria o tag che non aggiungono informazione oltre ai link già elencati, pagine legali (privacy policy, cookie policy) che non hanno valore citazionale, e ovviamente aree riservate o amministrative, che comunque robots.txt dovrebbe già escludere dall’accesso dei crawler.

    llms.txt aiuta davvero il posizionamento sugli agenti AI?

    È corretto essere onesti sui limiti di questo strumento. Nessun provider AI, né OpenAI né Anthropic né Google, ha confermato ufficialmente che i propri crawler leggano sistematicamente llms.txt e lo usino per determinare le citazioni. È una convenzione emersa dalla comunità tecnica, non uno standard con specifiche garantite come robots.txt, che invece è normato dal Robots Exclusion Protocol.

    Quello che possiamo dire, lavorando su siti che lo hanno implementato insieme ad altre ottimizzazioni GEO (schema markup corretto, contenuti con risposte dirette, robots.txt che non blocca i crawler AI), è che llms.txt si inserisce in una strategia di ottimizzazione complessiva che rende il sito più facilmente interpretabile, senza essere l’unico né il principale fattore. Va trattato come un tassello a basso costo di implementazione e nessun rischio, non come una soluzione risolutiva da sola.

    La combinazione corretta: llms.txt, robots.txt e schema markup insieme

    Il valore di llms.txt aumenta quando è coerente con gli altri segnali tecnici del sito. Un file llms.txt ben strutturato che punta a pagine bloccate da un robots.txt troppo restrittivo o da un firewall che blocca i crawler AI è inutile: il modello non riesce comunque ad accedere al contenuto indicato. Prima di implementare llms.txt vale sempre la pena verificare che GPTBot, ClaudeBot e Google-Extended abbiano accesso libero alle pagine che si vogliono valorizzare, verifica che copriamo nel dettaglio nell’articolo citato sopra su robots.txt e bot AI.

    Allo stesso modo, lo schema markup strutturato> sulle pagine linkate in llms.txt rafforza la comprensione automatica dei contenuti: i due strumenti lavorano a livelli diversi, uno organizza l’accesso ai contenuti, l’altro ne struttura il significato, e insieme costruiscono un profilo tecnico più solido per la citabilità AI.

    Se gestisci siti per conto di agenzie e vuoi verificare la configurazione GEO completa, incluso llms.txt, robots.txt e schema markup, su blurr.it/contatti/ puoi prenotare una chiamata per un audit tecnico.

    Domande frequenti

    No. È una convenzione emersa dalla comunità tecnica, non uno standard normato come il Robots Exclusion Protocol che regola robots.txt. Nessun provider AI ha confermato ufficialmente e sistematicamente di leggerlo e usarlo per determinare le citazioni, ma diversi crawler della community lo supportano ed è una pratica in crescita tra i siti orientati alla GEO.

    Robots.txt gestisce i permessi: dice ai crawler quali pagine possono o non possono leggere. llms.txt non gestisce permessi, è un indice curato dei contenuti principali del sito in formato markdown, pensato per essere letto rapidamente da un modello linguistico invece che analizzare l’HTML completo di ogni pagina.

    No. La sitemap XML resta lo strumento principale per l’indicizzazione di Google e per la scansione tradizionale. llms.txt è un livello complementare, specifico per l’ecosistema dei modelli linguistici, con un formato ottimizzato per la lettura AI piuttosto che per la scansione di un motore di ricerca classico.

    Per blog con pubblicazione frequente sì, altrimenti il file invecchia rapidamente e perde valore. La soluzione più efficiente è generarlo dinamicamente con una funzione che si aggiorna automaticamente ad ogni pubblicazione, invece di gestirlo come file statico da modificare manualmente.

Hai un cliente
che ti chiede un sito?

Scrivici per un preventivo gratuito e senza impegno.