🤖 IA para Empresas

robots.txt, llms.txt y bots de IA: cuáles permitir en 2026

Guía para configurar robots.txt y llms.txt ante GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended: qué bloquear, qué permitir y qué dice Google.

robots.txt, llms.txt y bots de IA: cuáles permitir en 2026

Respuesta corta: si quieres visibilidad en respuestas de IA, permite los bots de búsqueda (por ejemplo OAI-SearchBot y PerplexityBot), decide por separado si permites los bots de entrenamiento (GPTBot, ClaudeBot) y no bloquees Googlebot. llms.txt es opcional: Google dice que su Búsqueda lo ignora y no hay evidencia sólida de que mejore tus citas.

Lo más frecuente en auditorías es un robots.txt heredado, con reglas de bloqueo total o un cortafuegos que devuelve 403 a bots desconocidos. Es la comprobación con mejor relación esfuerzo-resultado del bloque 1 de la checklist de auditoría GEO.

¿Qué tipos de bot de IA existen?

Conviene separar tres usos, porque se controlan con reglas distintas:

UsoQué haceEjemplos
EntrenamientoRecopila contenido para entrenar modelosGPTBot (OpenAI), ClaudeBot (Anthropic), Applebot-Extended (Apple), CCBot (Common Crawl)
Búsqueda / indexaciónConstruye el índice que se consulta al responderOAI-SearchBot (OpenAI), Claude-SearchBot (Anthropic), PerplexityBot, Googlebot, Bingbot
Acción de usuarioVisita una página porque un usuario lo pidió en ese momentoChatGPT-User (OpenAI), Claude-User (Anthropic), Perplexity-User

Un matiz que casi nadie explica: los bots de acción de usuario no siempre respetan robots.txt. OpenAI indica que, como en ChatGPT-User la acción la inicia una persona, las reglas de robots.txt pueden no aplicarse. Perplexity dice de Perplexity-User que generalmente ignora robots.txt por la misma razón. Si necesitas impedir de verdad ese acceso, hay que hacerlo en el servidor o en el cortafuegos, no en robots.txt.

Otro dato útil, según la documentación de cada empresa: PerplexityBot no se usa para entrenar modelos fundacionales, solo para enlazar sitios en los resultados de Perplexity. Y OpenAI cuenta además con OAI-AdsBot, que valida la seguridad de las páginas enviadas como anuncios en ChatGPT; solo te afecta si anuncias allí.

Las plataformas cambian nombres y rastreadores con frecuencia. Los de esta tabla son los vigentes en su documentación oficial en septiembre de 2026; compruébalos antes de modificar reglas.

¿Qué permitir y qué bloquear según tu objetivo?

Objetivo A: máxima visibilidad en IA. Permite todo lo de búsqueda y de acción de usuario. Sobre entrenamiento, permitirlo también puede aumentar la presencia en el conocimiento base de los modelos, pero es una decisión de negocio.

Objetivo B: visibilidad sin ceder contenido al entrenamiento. Permite búsqueda y acción de usuario, y bloquea GPTBot, ClaudeBot, Applebot-Extended, CCBot y, si lo deseas, Google-Extended.

Objetivo C: no participar. Bloquea todos. Asume que dejarás de aparecer como fuente en los sistemas que respeten esas reglas.

Un robots.txt para el objetivo B se vería así (ajústalo a tu caso y verifica los nombres actuales):

# Búsqueda y acciones de usuario: permitidos
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

# Entrenamiento: bloqueado
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Resto de rastreadores, incluido Googlebot
User-agent: *
Allow: /

Sitemap: https://tudominio.com/sitemap.xml

¿Qué es Google-Extended y qué no controla?

Google-Extended es un token de robots.txt, no un rastreador con user agent propio: Google explica que no tiene una cadena de user agent HTTP separada y que el rastreo lo hacen sus user agents habituales. Con él decides si el contenido que Google ya rastrea puede usarse para entrenar futuras generaciones de modelos Gemini y para dar información en las aplicaciones Gemini y en Vertex AI. Google aclara que no afecta a la inclusión en Búsqueda ni se usa como señal de posicionamiento. Las Vistas creadas con IA y el Modo IA se alimentan del rastreo de Googlebot y se limitan con los controles de fragmentos (nosnippet, max-snippet, data-nosnippet), no con este token. Más en Vistas creadas con IA y Modo IA.

¿Cuánto tarda en notarse un cambio en robots.txt?

Depende de cada plataforma y ninguna promete plazos exactos. Como referencia, en su documentación para editores OpenAI indica que los cambios en robots.txt pueden tardar unas 24 horas en reflejarse en su comportamiento de búsqueda. Google relee robots.txt con frecuencia, pero los cambios sobre lo que ya está indexado pueden tardar días o semanas en verse en los resultados.

Si acabas de desbloquear un bot, no midas al día siguiente. Espera al menos dos semanas y comprueba en los registros que el bot ha vuelto a visitar tus páginas antes de sacar conclusiones sobre visibilidad.

¿Qué significa bloquear “solo el entrenamiento”?

Conviene entender qué estás decidiendo. Bloquear un bot de entrenamiento significa pedir que tu contenido no se use para entrenar futuros modelos. No borra lo que un modelo ya aprendió de versiones anteriores, y no impide que un asistente lea tu página en tiempo real si un usuario se la pide o si la recupera un bot de búsqueda que sí permites.

Por eso hay tres preguntas de negocio distintas:

  1. ¿Quiero que mi contenido forme parte del conocimiento base de futuros modelos? Puede ayudar a que la marca aparezca en respuestas sin búsqueda web, pero es imposible medirlo con precisión.
  2. ¿Quiero que se cite mi contenido cuando el usuario pregunta ahora? Esto lo controlan los bots de búsqueda y de acción de usuario.
  3. ¿Tengo obligaciones contractuales o de licencia sobre el contenido? Editoriales, medios y sitios con contenido de terceros suelen tener aquí su razón principal para bloquear.

Guía por tipo de negocio

Tipo de sitioPostura habitualRazón
Negocio de servicios local o pymePermitir búsqueda y acción de usuario. Entrenamiento: opcionalNecesita que lo recomienden; el contenido no es su producto
E-commercePermitir búsqueda. Revisar bots de acción de usuario si cargan el servidorLe interesa aparecer en recomendaciones de compra
SaaS y documentación técnicaPermitir casi todoLa documentación citada en asistentes ayuda a la adopción
Medio o editor con contenido de pagoBloquear entrenamiento; valorar acuerdos de licenciaEl contenido es el producto
Sitio con área privada o de miembrosProteger con autenticación, no con robots.txtrobots.txt no es un mecanismo de seguridad

Es una orientación, no una norma: la misma empresa puede querer posturas distintas en distintas secciones del sitio (por ejemplo, abrir el blog y cerrar la zona de recursos descargables).

Ejemplo: reglas distintas por sección

robots.txt admite reglas por ruta. Si solo quieres abrir tu blog y tus páginas de servicios a un bot concreto:

User-agent: OAI-SearchBot
Allow: /blog/
Allow: /servicios/
Disallow: /

En los rastreadores que interpretan el estándar de forma habitual, prevalece la regla más específica. Comprueba el resultado con un probador de robots.txt (por ejemplo, el de Search Console para Googlebot) y con los registros, porque cada rastreador implementa el estándar con pequeñas diferencias.

¿Por qué un bot permitido puede seguir sin entrar?

Porque robots.txt es solo una capa. Otras causas habituales:

  • Cortafuegos o CDN con reglas de “bots” que devuelven 403 o 429 a user-agents desconocidos.
  • Bloqueo por país o rango de IP que afecta a la infraestructura del bot.
  • Protección anti-bot con desafíos (captcha/JS) que el rastreador no supera.
  • Contenido renderizado solo con JavaScript, que algunos bots no ejecutan.

Cómo comprobarlo: revisa los registros del servidor o del CDN buscando cada user-agent y su código de respuesta. Si ves 200, entra. Si ves 403 o 429, hay un bloqueo aunque robots.txt lo permita.

Cómo verificar que un bot es quien dice ser

Cualquiera puede escribir “GPTBot” en la cabecera user-agent de una petición. Si vas a permitir o bloquear por identidad (en el cortafuegos, por ejemplo), verifica el origen:

  • Rangos de IP publicados: las plataformas publican los rangos de sus rastreadores. Anthropic, por ejemplo, indica que las direcciones válidas están en claude.com/crawling/bots.json y advierte de que bloquear por IP puede no funcionar correctamente, por lo que recomienda usar robots.txt. OpenAI y Perplexity documentan también sus rangos en las páginas de sus bots.
  • DNS inverso: en Googlebot se comprueba con una resolución inversa de la IP y otra directa del nombre obtenido. Es el método que documenta Google.
  • Volumen y patrón: un “bot” que hace miles de peticiones por minuto contra URL aleatorias suele ser un impostor o un rastreador mal configurado.

No pierdas horas en esto si tu prioridad es la visibilidad: permitir por user-agent en robots.txt y vigilar el registro es suficiente para la mayoría de webs.

Cómo leer los registros del servidor (ejemplo)

Si tienes acceso a los registros de acceso (Apache, Nginx o los de tu CDN), puedes contar visitas y códigos de respuesta por bot. Un ejemplo con línea de comandos:

# Peticiones de OAI-SearchBot por código de respuesta
grep "OAI-SearchBot" access.log | awk '{print $9}' | sort | uniq -c

# Últimas URL visitadas por PerplexityBot
grep "PerplexityBot" access.log | awk '{print $7}' | tail -20

Qué interpretar: muchos 200 significan acceso correcto; muchos 403 o 429 indican bloqueo o límite de tasa; la ausencia total del bot puede significar que aún no ha llegado, que está bloqueado en una capa superior (CDN) o que tu contenido no se ha descubierto (revisa el sitemap y los enlaces internos).

En servicios como Cloudflare, Vercel o Netlify los registros están en el panel o requieren activar una exportación. Si no puedes obtenerlos, el análisis de tráfico del CDN suele mostrar el tráfico de bots por categoría.

Ojo con los controles de IA de tu CDN o cortafuegos

Varios proveedores de CDN y seguridad han añadido opciones específicas para gestionar rastreadores de IA: interruptores para bloquear todos los bots de IA, listas gestionadas de bots conocidos o páginas de desafío. Si tu web pasa por un servicio así, revisa su panel de bots antes de asumir que tu robots.txt es lo único que cuenta:

  • Comprueba si hay una opción activada de “bloquear rastreadores de IA” que actúe por encima de lo que hayas escrito en robots.txt.
  • Comprueba si el proveedor gestiona o modifica tu robots.txt. En algunos casos puede anteponer reglas propias.
  • Después de cambiar cualquier ajuste, repite la verificación en los registros.

Es una de las causas más frecuentes de “tengo todo permitido y no aparezco”: el bloqueo estaba en una capa que nadie miraba.

¿Qué hay que saber de llms.txt?

llms.txt es una propuesta de archivo en Markdown, en la raíz del dominio, con un resumen del sitio y enlaces a sus contenidos clave, pensada para facilitar la lectura por modelos. Para decidir con criterio:

  • No es un estándar adoptado. Google indica que su Búsqueda lo ignora y que no ayuda ni perjudica a la visibilidad en sus funciones de IA.
  • No hay pruebas sólidas de impacto en las citas de otros asistentes. Puede que algunos agentes lo lean, pero no es un factor demostrado.
  • Coste bajo, beneficio incierto. Si lo generas automáticamente y lo mantienes actualizado, no hace daño. No debe desplazar prioridades como acceso, indexación o contenido citable.
  • No lo uses como escaparate de marketing. Manténlo factual: qué hace el sitio, qué secciones tiene, qué páginas son clave.

En Rewebia lo mantenemos porque es barato y se genera con cada compilación, pero no lo consideramos una palanca de posicionamiento.

Errores frecuentes al configurar robots.txt para bots de IA

  1. Copiar una lista de “bots de IA a bloquear” sin leerla. Algunas listas incluyen bots de búsqueda que te interesa mantener.
  2. Usar Disallow: / bajo User-agent: * y olvidar las excepciones. Bloquea a todos, incluidos los que querías permitir.
  3. Confundir Google-Extended con Googlebot. Bloquear el primero no te quita de Google. Bloquear el segundo, sí.
  4. Escribir mal el nombre del bot. GPT-Bot no es GPTBot, y la regla no se aplicará.
  5. Olvidar el sitemap. Declararlo ayuda a que los bots de búsqueda descubran tus páginas.
  6. No documentar la decisión. Dentro de un año nadie recordará por qué se bloqueó algo y se tomarán decisiones a ciegas.
  7. Asumir que robots.txt protege contenido sensible. No lo hace: cualquiera puede leer ese archivo y los bots que lo ignoran no se detienen.

Paso a paso para revisar tu configuración

  1. Abre tudominio.com/robots.txt y comprueba que existe y responde 200.
  2. Busca reglas Disallow: / bajo User-agent: * o bajo bots concretos que quieras permitir.
  3. Decide tu objetivo (A, B o C) y escribe reglas explícitas por bot.
  4. Verifica en el CDN y el cortafuegos que no haya reglas que bloqueen esos user-agents.
  5. Revisa los registros una o dos semanas después para confirmar que entran con código 200.
  6. Documenta la decisión: quién la tomó, por qué y cuándo revisarla.

¿Bloqueas bots de IA sin saberlo?

El diagnóstico gratuito de Rewebia analiza tu robots.txt y detecta qué rastreadores de IA quedan bloqueados, además de revisar tu llms.txt y tu sitemap.

Analizar mi web gratis →

Transparencia: la auditoría GEO es un servicio propio de Rewebia.

Conclusión

Configurar bien los bots de IA consiste en decidir con intención qué quieres: aparecer, entrenar o ninguna de las dos, y reflejarlo en reglas explícitas y comprobables. Permite la búsqueda si buscas visibilidad, separa la decisión sobre entrenamiento y verifica en los registros que la teoría se cumple. El resto, llms.txt incluido, viene después. Para los siguientes pasos, consulta cómo aparecer en ChatGPT, Perplexity y Gemini.

🔗 Sigue con estos recursos del mismo tema: Glosario de GEO, AEO y LLMO

robots.txtllms.txtgptbotoai-searchbotclaudebotperplexitybotgoogle-extendedbots de ia
¿Te ha sido útil?

Preguntas frecuentes

👤
Elaborado por:

Equipo Rewebia

Equipo editorial de Rewebia

Equipo editorial de Rewebia especializado en guías, comparativas y análisis documentales de herramientas digitales. El contenido se produce con asistencia de IA y supervisión mediante reglas editoriales y controles técnicos; no presentamos como experiencia propia una prueba que no esté documentada.

Criterio editorial

  • Investigación documental y comparación de alternativas
  • Controles editoriales y técnicos sobre contenido generado con IA
  • Transparencia en colaboraciones editoriales

Proceso editorial Rewebia

Los artículos se construyen a partir de documentación pública, criterios de decisión y límites conocidos. Las afirmaciones del proveedor se atribuyen como tales y los precios o funciones deben confirmarse en la fuente oficial. La publicación automatizada no equivale a una revisión humana completa de cada pieza.

Comentarios

Acepta las cookies para cargar los comentarios de GitHub.