Ilustración del artículo: llms.txt y datos estructurados: lo que leen las IAs de tu web
Posicionamiento en IA· 15 min de lectura

llms.txt y datos estructurados: lo que leen las IAs de tu web

DPor el equipo de DINOLABS · Actualizado el

Qué marcado de schema.org le sirve a una IA, qué es llms.txt y qué no, cómo manejar a los rastreadores desde robots.txt y cómo comprobar que quedó bien. Con ejemplos de JSON-LD listos para copiar.

Los datos estructurados para IA son etiquetas en el código de tu sitio, escritas con el vocabulario de schema.org y casi siempre en formato JSON-LD, que le dicen a una máquina qué es cada cosa: quién eres, qué vendes, dónde atiendes y qué respondes. Un modelo de lenguaje no adivina, lee. Si tu página trae marcado limpio, un archivo llms.txt con el mapa del sitio y un robots.txt que no bloquee a los rastreadores equivocados, tienes más opciones de aparecer citado cuando alguien le pregunta a un asistente por tu servicio.

Publicado el 21 de septiembre de 2026

Qué son los datos estructurados para IA

Tu página tiene dos lectores. Uno es una persona, que ve títulos, fotos y botones. El otro es una máquina, que ve etiquetas. Los datos estructurados para IA son la capa que le habla al segundo lector: un bloque de código que declara, sin ambigüedad, qué representa cada parte del contenido.

El vocabulario se llama schema.org. Es una lista de tipos y propiedades acordada entre los grandes buscadores. En vez de escribir "somos una empresa de software en Bogotá" y esperar que la máquina lo deduzca, declaras un objeto de tipo Organization con un nombre, una URL, un logo, una dirección y las áreas que atiendes. La frase sigue en la página para el humano. El objeto queda en el código para la máquina.

El formato recomendado es JSON-LD: un bloque de JSON dentro de una etiqueta script. No toca el diseño, no cambia el texto visible y se puede editar sin pelear con la maquetación. Google lo documenta en su introducción a los datos estructurados y cada tipo tiene su ficha pública, como la de Organization en schema.org.

Guarda esta idea, porque vuelve más adelante: schema.org sí es un estándar. Lleva más de una década en uso, los buscadores lo consumen todos los días y existen validadores oficiales para revisarlo. Otra pieza de este artículo, llms.txt, todavía no llegó a ese punto, y conviene tratarlas distinto.

Por qué un modelo lee mejor una página marcada

Un modelo no entiende tu sitio: lo convierte en texto y busca hechos que pueda repetir sin quedar mal. Cada ambigüedad que le quites es una razón menos para dejarte por fuera de la respuesta.

Un ejemplo. La palabra DINOLABS suelta en una página puede ser una marca, un producto o el nombre de un autor. Con un objeto Organization que trae name, url, sameAs, areaServed y knowsAbout, el dato deja de depender de la interpretación. Lo mismo pasa con un precio, un horario de atención o una pregunta frecuente: marcados son hechos, sin marcar son párrafos.

Hay medición sobre esto. El estudio de optimización para motores generativos (GEO), hecho por Princeton, Georgia Tech, el Allen Institute for AI e IIT Delhi y presentado en KDD 2024, midió hasta 40 % más de visibilidad en las respuestas de motores generativos al aplicar cambios de formato y contenido. Lo que más subió la visibilidad fue incluir citas, frases de fuentes y estadísticas. El paper está en arXiv.

El otro lado del asunto es el clic. Pew Research Center midió en julio de 2025 que los usuarios de Google hacen clic en un enlace el 8 % de las veces cuando aparece un resumen de IA, frente al 15 % cuando no aparece (Pew Research Center, 22 de julio de 2025). Si buena parte de los clics se evapora, aparecer dentro de la respuesta deja de ser un adorno. Si vienes llegando al tema, empieza por qué es el posicionamiento en IA.

Los tipos de schema.org que le sirven a una empresa

Existen cientos de tipos. A una empresa normal le sirven siete. El resto es ruido hasta que tengas un caso concreto que lo pida.

TipoPara qué sirveDónde va
OrganizationDeclara quién eres: nombre, logo, URL, redes y de qué sabes.Una sola vez, en el home, con un @id que reutilizas en todo el sitio.
LocalBusinessSuma dirección, teléfono, horario y zona que atiendes.Home o página de contacto, si tienes sede física o atiendes una ciudad.
ServiceDescribe un servicio, a quién va dirigido y dónde se presta.Cada página de servicio.
ProductNombre, precio, moneda, disponibilidad y reseñas.Cada ficha de producto de una tienda.
FAQPagePares de pregunta y respuesta en texto plano, listos para copiar.Páginas con preguntas frecuentes visibles en pantalla.
BreadcrumbListUbica la página dentro de la estructura del sitio.Toda página interna: blog, servicios, categorías.
ArticleTítulo, fecha, autor, editor, idioma e imagen de un contenido.Cada artículo del blog.

Una regla que ahorra dolores de cabeza: solo marcas lo que está visible en la página. Si publicas un FAQPage con preguntas que el usuario nunca ve, el marcado es inválido y te puede costar la elegibilidad a resultados enriquecidos. Si además estás rehaciendo el sitio, deja el marcado dentro del alcance desde el principio, como lo hacemos en las páginas web que construimos.

Dos bloques de JSON-LD que puedes copiar

El primero identifica a la empresa. Va una sola vez, en el home, dentro del <head> o justo antes de cerrar el <body>. El @id es la pieza clave: funciona como la dirección interna de tu organización y la vas a reutilizar como author y publisher en cada artículo. Cambia los valores de ejemplo por los tuyos.

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "LocalBusiness",
  "@id": "https://www.tuempresa.com/#organization",
  "name": "Tu Empresa SAS",
  "url": "https://www.tuempresa.com",
  "logo": "https://www.tuempresa.com/logo.png",
  "description": "Una frase corta que diga qué haces y para quién.",
  "telephone": "+57 300 000 0000",
  "address": {
    "@type": "PostalAddress",
    "streetAddress": "Calle 00 # 00-00",
    "addressLocality": "Bogotá",
    "addressRegion": "Cundinamarca",
    "addressCountry": "CO"
  },
  "areaServed": ["CO", "MX", "US"],
  "knowsAbout": ["tu servicio principal", "tu segundo servicio"],
  "sameAs": [
    "https://www.linkedin.com/company/tuempresa",
    "https://www.instagram.com/tuempresa"
  ]
}
</script>

El segundo convierte tus preguntas frecuentes en respuestas citables. Va en la página donde esas preguntas están visibles y el texto del marcado debe ser el mismo que lee el usuario, palabra por palabra.

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "¿Cuánto tarda la instalación?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Entre tres y cinco días hábiles después de aprobar la cotización."
      }
    },
    {
      "@type": "Question",
      "name": "¿Atienden fuera de la ciudad?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Sí, el soporte remoto cubre todo el país y las visitas presenciales van con cita previa."
      }
    }
  ]
}
</script>

Dos advertencias sobre estos bloques. La primera: las respuestas de un FAQPage aceptan HTML básico, pero conviene dejarlas en texto plano para que un modelo las copie sin basura alrededor. La segunda: no repitas el mismo bloque en todas las páginas del sitio. Un FAQPage por página y siempre el que corresponde a lo que esa página responde.

Qué es llms.txt y qué no es todavía

llms.txt es un archivo de texto en la raíz de tu dominio, escrito en Markdown, que le ofrece a un modelo un mapa corto y limpio de tu sitio: qué haces, cuáles son las páginas que importan y una línea de contexto por cada una. La idea es ahorrarle el trabajo de adivinar entre menús, banners y scripts. La propuesta está publicada en llmstxt.org.

Así se ve uno corto y real:

# DINOLABS

> Empresa colombiana de páginas web, agentes de IA, automatización de procesos, publicidad y posicionamiento (SEO y GEO). Más de 100 sitios entregados y más de 260 automatizaciones, con clientes en Colombia, México, Estados Unidos y Suiza.

## Servicios

- [Páginas web](https://www.dinolabs.dev/paginas-web): diseño y desarrollo de sitios a la medida.
- [SEO y posicionamiento en IA](https://www.dinolabs.dev/seo): visibilidad en buscadores y en respuestas de asistentes.

## Blog

- [Qué es el posicionamiento en IA](https://www.dinolabs.dev/blog/que-es-el-posicionamiento-en-ia-geo-para-empresas): qué cambia frente al SEO clásico.
- [Cómo medir el posicionamiento en IA](https://www.dinolabs.dev/blog/como-medir-el-posicionamiento-en-ia-de-tu-empresa): qué métricas sirven y cuáles no.

## Opcional

- [Cómo aparecer en ChatGPT](https://www.dinolabs.dev/blog/como-aparecer-en-chatgpt-cuando-preguntan-por-tu-servicio): el detalle operativo.

El hermano mayor es llms-full.txt: el mismo mapa, pero con el contenido completo en texto plano, pensado para que un modelo lo lea de una sola pasada sin recorrer el sitio. Sirve cuando tienes documentación o un blog grande y quieres entregarlo limpio.

Ahora lo incómodo. llms.txt es una propuesta, no un estándar. A diferencia de schema.org, no tiene detrás el consenso de los buscadores ni la garantía de que un proveedor de IA lo lea. Publicarlo cuesta menos de una hora y no le hace daño a nada. Esperar tráfico solo por tenerlo es otra cosa. Trátalo como un complemento barato del marcado, nunca como reemplazo, y no lo cuentes como el entregable principal de una estrategia.

Rastreadores de IA: permitir o bloquear desde robots.txt

No todos los bots de IA hacen lo mismo, y ahí se cometen los errores caros. OpenAI, por ejemplo, documenta agentes distintos: GPTBot, que recoge contenido para entrenamiento, y OAI-SearchBot, que alimenta la búsqueda y es el que habilita que tu enlace aparezca citado dentro de una respuesta (documentación de rastreadores de OpenAI). Bloquear a uno no es lo mismo que bloquear al otro.

Un robots.txt que deja pasar la búsqueda y restringe una zona privada se ve así:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /clientes/
Allow: /

User-agent: *
Allow: /

Sitemap: https://www.dinolabs.dev/sitemap.xml

La decisión es de negocio, no técnica. Si bloqueas el bot de búsqueda, desapareces de las citas de ese asistente y ya no compites por esa respuesta. Si bloqueas solo el de entrenamiento, conservas la posibilidad de ser citado y le cierras la puerta al uso de tu contenido para entrenar modelos. Para una empresa que vende servicios, dejar abierta la búsqueda casi siempre conviene. Para un medio que vive de suscripciones, la cuenta puede dar distinto.

Dos precisiones. Primera: robots.txt es una convención de buena fe, no un muro. Un rastreador que decida ignorarlo lo ignora, así que para contenido sensible usa autenticación, no una línea de texto. Segunda: los nombres de los agentes cambian y aparecen nuevos cada tanto. Revisa la documentación del proveedor antes de copiar reglas viejas de otro sitio, porque una regla mal escrita apaga visibilidad durante meses sin que nadie se dé cuenta.

Cómo escribir para que el texto sea citable

El marcado le dice a la máquina qué es cada cosa. El texto le da algo que valga la pena repetir. Sin lo segundo, lo primero no sirve de mucho.

  • Responde primero. Abre cada sección con la respuesta completa en dos o tres frases, que se entienda sacada de contexto. Un modelo suele tomar el primer bloque que resuelve la pregunta, no el que mejor cierra el argumento.
  • Una idea por párrafo. Tres o cuatro líneas y punto aparte. Los párrafos largos obligan a recortar y, cuando un sistema recorta, o pierde el matiz o te descarta y toma a otro.
  • Usa tablas y listas. Una comparación en tabla se copia entera y sin errores. La misma comparación en prosa se deshace. Lo mismo aplica a pasos numerados, requisitos y criterios de decisión.
  • Cifras con fuente y fecha. Esto no es estilo, es lo que midió el estudio GEO: las citas, las frases de fuentes y las estadísticas fueron los cambios que más subieron la visibilidad, hasta 40 %. Un dato sin fuente es una opinión; con fuente y fecha, es material citable.
  • Nombra las cosas completas. Escribe "DINOLABS, empresa colombiana de páginas web y agentes de IA", no "nosotros". Un modelo arma la respuesta con entidades, y "nosotros" no es una entidad que pueda citar.

Si quieres el detalle de cómo se arma ese contenido pregunta por pregunta para tu mercado, está en cómo aparecer en ChatGPT cuando preguntan por tu servicio, y así lo trabajamos dentro de nuestro servicio de SEO y posicionamiento en IA.

Cómo comprobar que quedó bien

Publicar el marcado y confiar es el error más común. Estas cuatro revisiones toman veinte minutos y evitan meses de nada.

  1. Prueba de resultados enriquecidos. Es la herramienta de Google que carga tu URL y te dice qué tipos detectó y con qué errores. Si responde que no encontró datos estructurados, el bloque no está llegando, así lo veas perfecto en tu editor.
  2. Validador de schema.org. El validador oficial revisa el vocabulario completo, no solo lo que Google usa para mostrar resultados enriquecidos. Sirve para propiedades como knowsAbout, areaServed o tipos como Service, que no generan un resultado visual pero sí describen bien la entidad.
  3. Revisa el HTML renderizado, no solo el código fuente. Si tu sitio inyecta el JSON-LD con JavaScript del lado del cliente, un rastreador que no ejecuta scripts no lo va a ver nunca. Compara la respuesta cruda del servidor con el DOM final que muestra el inspector. Si el bloque solo aparece en el DOM, muévelo al HTML que entrega el servidor.
  4. Pide los archivos como los pide un bot. Descarga /robots.txt, /llms.txt y /sitemap.xml sin sesión iniciada y revisa que respondan en texto plano, sin redirecciones raras y sin la página de error de tu framework. Un llms.txt que devuelve HTML no existe para quien lo lee.

Después viene la medición real: preguntarle a los asistentes por tu categoría y anotar si te nombran. Ese seguimiento lo explicamos en cómo medir el posicionamiento en IA de tu empresa, y el panorama local en posicionamiento en IA para empresas en Colombia.

Preguntas frecuentes

¿Los datos estructurados para IA garantizan que ChatGPT me cite?

No. Garantizan que tu información sea legible y consistente, que es condición necesaria y no suficiente. Un asistente cita lo que encuentra, entiende y considera confiable para esa pregunta concreta. El marcado resuelve la parte de entender y ayuda con la de confiar, pero no reemplaza tener contenido que responda de verdad ni que otros sitios te mencionen. Piensa en el marcado como el cableado de una casa: sin él no prende nada, y con él todavía falta comprar el aparato.

¿Vale la pena publicar llms.txt si todavía no es un estándar?

Sí, con expectativas realistas. El archivo se escribe en menos de una hora, se mantiene solo si tu sitio no cambia cada semana y no le hace daño a nada. Lo que no debes hacer es contarlo como la acción central de tu posicionamiento ni esperar tráfico por el solo hecho de tenerlo. Mientras ningún proveedor grande confirme que lo consume, trátalo como una apuesta barata. La inversión seria va en schema.org, que los buscadores sí leen hoy.

¿Bloquear a GPTBot me saca de las respuestas de ChatGPT?

Depende del agente que bloquees. GPTBot recoge contenido para entrenamiento; OAI-SearchBot alimenta la búsqueda que permite citar tu página con enlace. Si bloqueas el segundo, pierdes la opción de aparecer cuando alguien pregunta por tu servicio. Si bloqueas solo el primero, conservas la cita y renuncias al entrenamiento. Revisa la documentación de OpenAI antes de tocar el archivo, porque los nombres cambian y una línea mal puesta apaga la visibilidad sin aviso ni error visible.

¿Qué pasa si marco contenido que no está visible en la página?

Es una violación de las directrices y puede costarte la elegibilidad a resultados enriquecidos, incluso una acción manual sobre el sitio. El caso típico es un FAQPage con veinte preguntas cuando en pantalla hay tres. La regla es simple: el texto del marcado debe existir en el HTML que ve el usuario, con las mismas palabras. Si quieres marcar más preguntas, publícalas en la página. Si no las quieres publicar, no las marques y listo.

¿Cuántos tipos de schema necesita una empresa pequeña?

Cuatro alcanzan para empezar: Organization o LocalBusiness en el home, Service en cada página de servicio, BreadcrumbList en las páginas internas y Article en el blog. FAQPage entra cuando tengas preguntas frecuentes visibles y Product solo si vendes en línea. Más tipos no significa mejor lectura; significa más código que mantener y más sitios donde equivocarse. Empieza por la entidad de la empresa bien hecha y crece desde ahí, sin afán.

DINOLABS es una empresa colombiana que hace páginas web, agentes de IA, automatización de procesos, publicidad y posicionamiento (SEO y GEO). Llevamos más de 100 sitios entregados y más de 260 automatizaciones, con clientes en Colombia, México, Estados Unidos y Suiza. Nuestro servicio de posicionamiento en ChatGPT y buscadores con IA hace exactamente este trabajo.

Si quieres que revisemos tu marcado, tu llms.txt y tu robots.txt, y dejemos los datos estructurados para IA funcionando en tu sitio, escríbenos desde el formulario y te decimos en concreto qué falta.

¿Listo para automatizar tu negocio?
>_ Cuéntanos tu proyecto
Sigue leyendo
Posicionamiento en IA
Posicionamiento en IA: qué es el GEO y cómo funciona
Qué es el posicionamiento en IA, en qué se diferencia del SEO, cómo arma una IA su respuesta, d
Posicionamiento en IA
Cómo aparecer en ChatGPT cuando preguntan por tu servicio
ChatGPT no tiene ranking: cuando busca en vivo escoge unas pocas fuentes y las cita. Acá está c
Posicionamiento en IA
Cómo medir si las IAs están recomendando tu empresa
¿ChatGPT recomienda tu empresa o a la competencia? Te mostramos cómo montar un panel de 20 a 40
DINOLABS
+57 300 425 3257contacto@dinolabs.devBogotá, Colombia