Arquitectura web orientada a IA: 5 pilars tècnics

Resposta ràpida

Una arquitectura web orientada a IA és la que permet als crawlers de motors de resposta (GPTBot, ClaudeBot, PerplexityBot) rastrejar, entendre i extreure el teu contingut amb el mínim d’obstacles. Els seus cinc pilars són: robots.txt amb permisos explícits per a bots d’IA, cadenes de redirecció de màxim 2 salts, jerarquia semàntica clara amb headings correctes, schema orientat a entitat (Organization + Person), i sitemaps XML actualitzats. L’llms.txt està de moda però és opcional: adopció per bots encara baixa i limitada el 2026.

Aquest article és el més tècnic del silo, i no dóna voltes. Va dirigit a qui vol entendre exactament com estructurar el seu web perquè motors d’IA com ChatGPT, Perplexity i Claude puguin rastrejar-lo, processar-lo i citar-lo. Moltes webs ben posicionades a Google són invisibles per a la IA per errors d’arquitectura que Googlebot tolera i els bots d’IA no.

Una dada que il·lustra per què això importa: el 2024, el 35,7 % del top 1.000 de webs bloquejava GPTBot — i moltes sense saber-ho. És l’error més comú: bloquejar la IA per accident i preguntar-te per què ningú et cita.

Els 5 pilars d’una arquitectura orientada a IA

1

robots.txt: la palanca real d’accés

Aquest és l’arxiu que decideix si els bots d’IA poden entrar o no. No és opcional. Si el teu robots.txt no té regles específiques per a bots d’IA, tots segueixen la directiva User-agent: *. Si aquesta per defecte és restrictiva, els estàs bloquejant sense voler. Ho desenvolupo al bloc següent amb configuració específica.

2

Cadenes de redirecció curtes (màxim 2 salts)

Aquest és l’error tècnic que més webs ben posicionades a Google mata en IA. Dades de Captain DNS (2026): Googlebot tolera fins a 10 salts de redirecció; els crawlers d’IA en temps real (OAI-SearchBot, Claude-SearchBot, Perplexity-User) abandonen al tercer salt sense reintentar. Una cadena que passa per Google elimina la teva pàgina de les respostes d’IA sense senyal d’error. L’objectiu ha de ser 1-2 salts com a màxim.

3

Jerarquia semàntica neta (H1 → H2 → H3)

Els motors d’IA parsegen l’HTML igual que Google, però amb menys tolerància al desordre. Un H1 per pàgina, H2 per a seccions, H3 per a subseccions. Sense salts (mai H1 → H3). Els headings han de descriure realment el contingut que segueix — la IA extreu fragments fent servir aquesta estructura com a guia. Un heading vague («La nostra proposta») rendeix pitjor que un descriptiu («Com estructurem una auditoria SEO en 4 fases»).

4

Schema orientat a entitat (no només per pàgina)

La IA construeix grafs de coneixement, no llistes de pàgines. Prioritat: Organization amb sameAs a LinkedIn, Wikidata i perfils reals; Person per a autors amb credencials; knowsAbout amb els teus temes. L’objectiu és que la IA identifiqui la teva marca com a entitat, no com a col·lecció de pàgines. Ho desenvolupo a dades estructurades: com ajuden al SEO i a la IA.

5

Sitemap XML actualitzat i accessible

Continua sent la manera més eficient de dir-li a un crawler quines pàgines tens i quan s’actualitzen. Declaració a robots.txt (Sitemap: https://elteuweb.com/sitemap.xml), dates <lastmod> reals (no falsejades), i totes les URLs importants incloses. Amb WPML o multiidioma: un sitemap per idioma o un índex de sitemaps.

Configuració robots.txt pràctica per a IA

Aquí està el matís important que gairebé ningú explica: hi ha dos tipus de bots d’IA i cal tractar cadascun de manera diferent. Els bots d’entrenament (GPTBot, Google-Extended, CCBot, anthropic-ai) recullen contingut per entrenar models futurs. Els bots de recuperació (ChatGPT-User, Claude-User, PerplexityBot, OAI-SearchBot) llegeixen el teu web en temps real quan algú fa una pregunta que menciona la teva categoria.

L’estratègia més comuna el 2026: bloquejar entrenament, permetre recuperació. Bloqueges que el teu contingut entri en models futurs (decisió de propietat intel·lectual) mentre deixes que la IA et citi en respostes de temps real (decisió de visibilitat). Exemple:

# Bots d’entrenament — BLOQUEJAR
User-agent: GPTBot
User-agent: Google-Extended
User-agent: CCBot
User-agent: anthropic-ai
Disallow: /
# Bots de recuperació — PERMETRE
User-agent: ChatGPT-User
User-agent: OAI-SearchBot
User-agent: Claude-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
# Sitemap
Sitemap: https://elteuweb.com/sitemap.xml

Si vols màxima visibilitat en IA sense restriccions (recomanat si la teva prioritat és aparèixer citat i no et preocupa l’ús per a entrenament), la configuració es simplifica: permet tot explícitament.

Avís important sobre CDN

Si fas servir Cloudflare o un altre CDN, la capa del CDN pot sobreescriure el teu robots.txt. Cloudflare ha implementat bloquejos per defecte per a bots d’IA en diverses configuracions, i moltes webs bloquegen crawlers al CDN mentre el robots.txt diu «permetre». Les dues capes han d’estar alineades: revisa el panell del CDN, no només el robots.txt del servidor.

llms.txt: entre el bombo i la utilitat real

L’llms.txt és un arxiu Markdown proposat per Jeremy Howard (Answer.AI) el setembre de 2024 que viu a l’arrel del domini i dóna als LLMs un resum curat del teu contingut. En els últims mesos ha guanyat una atenció mediàtica enorme. I aquí toca ser honestos.

El que és cert: Anthropic el referencia a la seva documentació, Google l’inclou en experiments del protocol A2A, i alguns crawlers d’IA visiten l’arxiu quan existeix.

El que també és cert: cap proveïdor major d’IA ha declarat oficialment que el processi en producció, l’adopció per dominis és d’aproximadament el 0,3 % del top 1.000 de webs (març 2026), i anàlisis independents conclouen que no se li atribueix efecte material en la recuperació d’IA el 2026.

La meva recomanació pràctica: si tens 1-2 hores, implementa’l — és low-risk, low-effort i funciona com a acte d’higiene informacional per al dia que sí el llegeixin. Però no el prioritzis per sobre de robots.txt, schema o headings, que sí tenen impacte mesurable avui. I no el tractis com a «control d’accés»: no ho és. És una guia suggerida, no una barrera tècnica.

Com estructurar l’HTML perquè la IA l’extregui bé

L’arquitectura d’accés (robots.txt, redireccions) fa que la IA pugui entrar. L’arquitectura semàntica fa que vulgui citar-te. Cinc regles concretes:

Resposta directa autocontinguda al primer paràgraf

La IA extreu cites literals preferentment dels primers 40-60 paraules d’una secció. Si el teu primer paràgraf és introductori o de context sense dada, no hi ha cita. Cada H2 hauria d’anar seguit d’un paràgraf que respongui directament la pregunta implícita d’aquell heading.

Taules i llistes numerades freqüents

Els LLMs extreuen taules i llistes molt millor que paràgrafs llargs. En articles de més de 1.000 paraules, almenys una taula comparativa o una llista numerada. No les posis per posar — posa-les quan el contingut ho demani naturalment (comparatives, seqüències, checklists).

Dates visibles: publicació i actualització

La IA valora la recència. Publica a l’HTML tant la data de publicació com la d’última actualització (amb datePublished i dateModified a schema Article). Un article del 2026 serà citat abans que un del 2022 sobre el mateix tema, encara que el segon tingui més autoritat.

Sense JavaScript bloquejant per a contingut crític

Els crawlers d’IA avui són menys capaços que Googlebot renderitzant JavaScript. Si el contingut principal només es carrega després d’executar JS, per a molts bots d’IA no existeix. Server-side rendering, contingut a l’HTML del primer response, o renderitzat híbrid. Un React sense SSR és una arquitectura hostil a IA.

Enllaços interns amb anchor descriptiu

Els anchors «fes clic aquí» o «més info» no diuen res a la IA. Anchors descriptius amb la keyword del destí («guia completa de schema per a IA») ajuden la IA a entendre el mapa del teu contingut i a construir cadenes de citació relacionades.

Errors arquitectònics que fan invisible el teu web a la IA

Els cinc que més veig en webs ben posicionades a Google que no apareixen a ChatGPT ni a Perplexity:

Error Com detectar-lo i arreglar-lo
robots.txt bloqueja GPTBot per defecte Visita elteuweb.com/robots.txt i busca regles per a GPTBot/ClaudeBot/PerplexityBot. Si no hi apareixen o hi ha Disallow: / general, revisa. Molts plugins de seguretat els bloquegen per defecte.
Cadenes de redirecció de 3+ salts Fes servir curl o eines com httpstatus.io. Cadenes típiques problemàtiques: HTTP → HTTPS → www → carpeta canònica. Col·lapsa en una sola redirecció.
Contingut dependent de JavaScript Desactiva JS al teu navegador i visita el teu web. Si el contingut principal desapareix o queda en blanc, tens un problema seriós d’accessibilitat per a IA.
Múltiples H1 o jerarquia trencada Extensions com HeadingsMap (Chrome) mostren la jerarquia visual. Un H1 per pàgina, sense salts H1 → H3 sense H2 al mig.
Bloqueig des del CDN (Cloudflare, etc.) Revisa el panell del teu CDN. Cloudflare té «Block AI Scrapers» i configuracions automàtiques que poden estar actives sense que ho hagis configurat explícitament.

Checklist d’arquitectura per a IA

Deu comprovacions concretes. Amb cinc o més ❌, el teu web probablement no apareix en respostes d’IA encara que rankegi a Google.

  • robots.txt permet (explícitament) almenys ChatGPT-User, Claude-User i PerplexityBot.
  • El CDN no bloqueja crawlers d’IA per defecte.
  • Cadenes de redirecció d’1-2 salts màxim a URLs importants.
  • Sitemap XML declarat a robots.txt i amb lastmod real.
  • Un H1 per pàgina, jerarquia H2/H3 sense salts.
  • Contingut crític accessible sense JavaScript (o amb SSR ben implementat).
  • Schema Organization amb sameAs i Person per a autors.
  • Resposta directa autocontinguda als primers 40-60 paraules de cada article.
  • Dates de publicació i actualització visibles a l’HTML i a schema Article.
  • llms.txt a l’arrel (opcional, low-priority — no el prioritzis per sobre dels altres).

La teva arquitectura web deixa passar els motors d’IA?

Reviso el teu web amb criteri tècnic de SEO per a IA (AEO): robots.txt, cadenes de redirecció, jerarquia semàntica, schema i accessibilitat. Et torno un pla concret de què arreglar perquè ChatGPT, Perplexity i Claude et puguin llegir i citar.

Preguntes freqüents

Què és una arquitectura web orientada a IA?

És l’estructura tècnica que permet als crawlers de motors de resposta (GPTBot, ClaudeBot, PerplexityBot) rastrejar, processar i extreure el teu contingut amb el mínim d’obstacles. Els seus cinc pilars són: robots.txt amb permisos explícits, cadenes de redirecció de màxim 2 salts, jerarquia semàntica neta, schema orientat a entitat i sitemap XML actualitzat.

He de permetre o bloquejar GPTBot al meu robots.txt?

Depèn de les teves prioritats. GPTBot és el bot d’entrenament d’OpenAI (recull el teu contingut per entrenar models futurs). Bloquejar-lo és una decisió de propietat intel·lectual, però no afecta que ChatGPT et citi en respostes en temps real, ja que això ho fan OAI-SearchBot i ChatGPT-User. Si la teva prioritat és visibilitat en IA, permet almenys els bots de recuperació (ChatGPT-User, Claude-User, PerplexityBot).

És imprescindible tenir un arxiu llms.txt?

No és imprescindible el 2026. És un estàndard proposat el setembre de 2024 amb adopció encara baixa: aproximadament el 0,3 % del top 1.000 de webs l’implementa, i cap proveïdor major d’IA ha declarat oficialment que el processi en producció. És low-risk i low-effort (1-2 hores), però no el prioritzis per sobre de robots.txt, schema o headings, que sí tenen impacte mesurable avui.

Per què les cadenes de redirecció afecten més la IA que Google?

Perquè els bots d’IA tenen límits més estrictes. Googlebot tolera fins a 10 salts de redirecció, però els crawlers d’IA en temps real (OAI-SearchBot, Claude-SearchBot, Perplexity-User) abandonen al tercer salt sense reintentar. Una cadena que passa per a Google pot eliminar la teva pàgina de les respostes d’IA sense cap senyal d’error visible. L’objectiu ha de ser 1-2 salts com a màxim.

El meu web amb React sense SSR és un problema per a la IA?

Sí, és un problema seriós. Els crawlers d’IA avui són menys capaços que Googlebot renderitzant JavaScript. Si el contingut principal només es carrega després d’executar JS al navegador, per a molts bots d’IA aquell contingut literalment no existeix. La solució és implementar server-side rendering (SSR), renderitzat híbrid, o generar HTML estàtic per a les pàgines crítiques. Un React pur sense SSR és una arquitectura hostil a IA.

Expert en WordPress, Optimització SEO i Experiència d'Usuari (UX) | Ajudo autònoms i PIMEs a créixer el seu negoci. | Especialista en Disseny i Desenvolupament Web per a Startups, PIMEs i Projectes Personals. Llegir més sobre l'Àlex

ALHOSTINGS
Resum de la privadesa

Aquest lloc web utilitza galetes per tal de proporcionar-vos la millor experiència d’usuari possible. La informació de les galetes s’emmagatzema al navegador i realitza funcions com ara reconèixer-vos quan torneu a la pàgina web i ajuda a l'equip a comprendre quines seccions del lloc web us semblen més interessants i útils.