Cómo estructurar tu página web para que ChatGPT, Gemini y Perplexity la citen
El CTR orgánico cae 34,5% cuando aparece un resumen de IA. La estructura técnica, el schema y el llms.txt que hacen que las IAs citen tu sitio.
Para que una IA cite tu página, tu contenido tiene que ser extraíble: la respuesta a la pregunta en las primeras 60 palabras, secciones que se entienden solas si se leen fuera de contexto, datos con fuente y año en la misma frase, tablas comparativas, schema FAQPage y Article válidos, y una identidad de empresa consistente en toda la web. Las IAs no leen tu página completa: extraen fragmentos. Si tus fragmentos no se sostienen solos, no te citan.
Publicado y actualizado el 2 de julio de 2026.
¿Qué está pasando con tu tráfico orgánico? Los números
Tu tráfico orgánico cae porque el resumen generado por IA que Google coloca encima de los resultados se queda con el clic. Cuando aparece un resumen de IA, los usuarios hacen clic en un resultado tradicional en el 8% de las visitas, frente al 15% cuando no aparece, y solo el 1% hizo clic en un enlace dentro del propio resumen, según el estudio de Pew Research Center (2025) sobre 68.879 búsquedas reales de 900 adultos en Estados Unidos.
El golpe se concentra donde está tu mejor posición: la presencia de AI Overviews reduce el CTR de la posición 1 en aproximadamente 34,5%, según el análisis de 300.000 keywords de Ahrefs (2025).
Ahora el dato incómodo. El tráfico de referencia de IA fue el 0,14% del tráfico total en 2025, pese a crecer 66%, mientras la búsqueda orgánica aportó el 16,04%, según el estudio de Semrush (2026) sobre más de 50.000 sitios.
Las dos cosas son verdad a la vez, y esa es la trampa: el daño llega antes que la compensación. La decisión correcta no es abandonar el posicionamiento clásico —si aún no lo tienes resuelto, empieza por cómo aparecer primero en Google sin pagar publicidad— sino añadirle una capa de estructura.
SEO, AEO y GEO: ¿qué cambia realmente en tu sitio?
Cambia la estructura, no las keywords. El SEO es el trabajo de relevancia y autoridad que sirve para que un buscador te posicione en una lista de enlaces. El AEO (answer engine optimization) es la práctica de redactar respuestas autónomas que sirve para que un motor de respuestas tome tu texto como respuesta directa. El GEO (generative engine optimization) es el trabajo de estructura, evidencia e identidad que sirve para que un modelo de lenguaje pueda extraer, atribuir y citar un fragmento tuyo.
Son tres capas sobre el mismo contenido: el GEO no reemplaza al SEO, se monta encima. Si tu página no está indexada, no hay GEO posible.
| Criterio | SEO | AEO | GEO |
|---|---|---|---|
| Qué compite | Una posición en la lista de resultados | El bloque de respuesta destacada | Ser la fuente que el modelo usa y menciona |
| Unidad de trabajo | La página | La pregunta | El fragmento |
| Palanca principal | Intención, enlaces, rendimiento | Respuesta corta arriba, marcado de preguntas | Estructura extraíble, datos citados, entidad consistente |
| Cómo se mide | Posiciones, clics, impresiones | Aparición en fragmentos destacados | Menciones en respuestas, referidos de chatbots |
| Qué pasa si falta | No apareces en ningún lado | Apareces debajo de la respuesta | Te leen, te resumen y no te nombran |
La consecuencia práctica: casi todo el GEO se hace con el editor de texto abierto.
El principio: las IAs extraen fragmentos, no leen páginas
Un modelo no consume tu artículo de arriba abajo: un sistema de recuperación parte tu página en bloques, los indexa por separado y le entrega al modelo solo los tres o cuatro que parecen responder la pregunta. Si ese bloque no basta para entender la idea ni para saber de dónde salió el dato, no te cita.
Un fragmento extraíble es un bloque de texto que se entiende sin el resto de la página y que sirve para que el modelo lo reproduzca sin ambigüedad. Ese es el estándar de cada sección.
De ahí salen tres prohibiciones. Ninguna sección puede abrir con «como vimos antes» o «siguiendo con lo anterior»: fuera de contexto, esas frases convierten el bloque en basura. Ningún pronombre puede apuntar a algo que está tres párrafos arriba. Y la conclusión de la sección va en el primer párrafo, no en el último.
El control es simple: copia una sección de tu web, pégala sola en un documento en blanco y léela. Si necesitas volver a la página para entenderla, esa sección no existe para una IA.
La estructura de página que sí se cita
La estructura que se cita es la que hace coincidir la pregunta del usuario con un bloque cerrado de tu página. Cinco decisiones de formato concentran el efecto.
Pregunta como H1, respuesta de 40-60 palabras arriba del pliegue
El H1 debe ser la pregunta completa que alguien escribiría en un chat, no una keyword recortada. «Cuánto cuesta automatizar la facturación de una pyme en Colombia» funciona; «Costos de automatización» no. Debajo, un párrafo de 40 a 60 palabras que la responde entera: es el candidato número uno a ser citado.
Un H2 = una pregunta completa que se responde en su propio bloque
Cada H2 cubre una sola pregunta y la resuelve dentro de su sección, entre 150 y 350 palabras. Más largo se fragmenta mal; más corto no aporta. Escribe los H2 como preguntas reales: son el índice que el sistema de recuperación empareja con la consulta.
Frases definicionales explícitas
Incluye frases con la estructura «X es Y que sirve para Z». Un modelo las extrae como definiciones canónicas porque no tiene que interpretarlas. «Un agente de IA es un sistema que interpreta el mensaje del cliente y ejecuta una acción» es citable; «los agentes de IA están cambiando la atención al cliente» no.
Tablas comparativas: el formato que más se extrae
Una tabla en HTML real, con <thead> y <tbody>, es lo que los modelos reproducen con más fidelidad: cada celda viene etiquetada con su fila y su columna. Una comparación escrita en párrafos obliga al modelo a reconstruir la relación, y falla a menudo. Una imagen de tabla no sirve: no es texto.
Listas numeradas con criterios, no con adjetivos
Una lista numerada funciona cuando cada punto es un criterio verificable o un paso ejecutable: «Confirma que el contenido se ve sin JavaScript». Deja de funcionar cuando es una lista de adjetivos: «rápido, moderno, escalable», que se descarta como relleno promocional.
Sobre una página que ya existe, el orden de aplicación es este:
- Reescribe el H1 como pregunta y pon debajo la respuesta de 40 a 60 palabras.
- Convierte cada H2 en pregunta y mueve la conclusión al primer párrafo de su sección.
- Elimina las referencias internas tipo «como vimos antes» y repite los sujetos.
- Añade una tabla comparativa y una lista numerada de criterios donde el texto compare.
- Pon fuente, año y enlace en la misma frase de cada cifra; borra las que no la tengan.
- Inyecta el schema y verifica que cada respuesta marcada coincide con la visible.
Los datos son el activo, no las keywords
Un artículo con tres cifras bien atribuidas se cita más que uno de 3.000 palabras sin ninguna, porque el modelo necesita algo que pueda respaldar. Si tu texto no lleva la fuente pegada al dato, el modelo se queda con el dato y cita a otro.
El formato no admite variantes: dato, fuente nombrada, año y enlace, todo en la misma frase. «Los AI Overviews reducen el CTR de la posición 1 en un 34,5%, según Ahrefs (2025)» es utilizable. «Estudios muestran una caída del CTR» es inservible: lo que el modelo no puede atribuir sin salir del fragmento, no lo repite.
Esto explica también qué tipo de fuentes ganan. Los dominios más citados por los buscadores con IA son Reddit, YouTube y LinkedIn, seguidos de Wikipedia, según el análisis de 30 millones de fuentes de Peec AI, publicado por Search Engine Land (2026). No los vas a desplazar, pero la lectura útil es que se cita experiencia concreta, no páginas de servicios.
Para una empresa eso significa publicar lo que solo tú puedes publicar: precios reales de tu mercado, plazos medidos, errores que se repiten en tus proyectos. Es lo que casi ningún blog corporativo en Colombia hace, y por eso ninguno se cita.
Marcado técnico: el schema que sí importa
El schema JSON-LD es un bloque de datos estructurados que sirve para declararle a una máquina qué es cada parte de tu página sin que la deduzca del diseño. No te hace citable por sí solo, pero elimina ambigüedad. Cinco tipos cubren lo que necesita un blog de empresa.
Article con author, datePublished y dateModified
Declara autor, fecha de publicación y fecha de modificación. Las dos fechas tienen que coincidir con las visibles: si el schema dice una cosa y el texto otra, la inconsistencia juega en tu contra.
FAQPage con texto idéntico al visible
El FAQPage marca pares de pregunta y respuesta. La regla que más se incumple es la más simple: el texto de la respuesta en el schema debe ser el que aparece en pantalla. Marcar lo que el usuario no ve es spam.
Organization con sameAs hacia tus perfiles
El bloque Organization define tu empresa —nombre, sitio, logo— y el campo sameAs la enlaza con LinkedIn y Google Business Profile. Así una máquina sabe que esos perfiles son la misma entidad.
BreadcrumbList
La ruta Inicio > Blog > Artículo le da al sistema la jerarquía del sitio y el tema padre de cada pieza. Ayuda a que tus artículos se agrupen como cuerpo temático.
HowTo cuando el contenido es un procedimiento
Si tu artículo describe pasos ejecutables en orden, márcalos con HowTo. Solo cuando de verdad hay un procedimiento: marcarlo cuando no lo hay es como inventar un FAQPage.
llms.txt y robots.txt: dejar entrar a los rastreadores correctos
Antes de optimizar nada, comprueba que los rastreadores de IA pueden entrar: si tu robots.txt bloquea GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot o Google-Extended, tu contenido no puede aparecer en esas respuestas. Muchos sitios los bloquean sin haberlo decidido, porque el plugin venía así.
Es una decisión de negocio, no técnica. Si vives de vender contenido, bloquear es coherente. Si tu contenido es lo que atrae clientes, bloquear es cerrarte el canal. Conviene distinguir los agentes que entrenan modelos de los que buscan y citan en tiempo real.
El llms.txt es un archivo de texto plano en la raíz del dominio que sirve para darle a un modelo un mapa curado de tu sitio: quién eres, qué haces y cuáles son tus páginas importantes, en Markdown y sin menús ni banners.
Hay que ser claro sobre su estado: es una propuesta comunitaria, no un estándar oficial, y su adopción por parte de los grandes modelos es desigual y no está confirmada. Cuesta media hora, no rompe nada y obliga a ordenar qué páginas consideras importantes. Si alguien te lo vende como el requisito que decide si ChatGPT te cita, te está vendiendo humo.
Consistencia de entidad: que la IA sepa quién eres
Un modelo no sabe que tu empresa existe: la reconstruye a partir de coincidencias entre fuentes. Si tu web dice «desarrollo de software», tu LinkedIn «agencia digital» y tu Google Business Profile «diseño gráfico», no hay entidad clara.
La corrección es aburrida y funciona: una sola descripción de la empresa, replicada textualmente en la home, en el pie de página, en el bloque Organization del schema, en LinkedIn, en Google Business Profile y en cada directorio. Mismo nombre, mismos servicios, misma ciudad, mismo teléfono.
Añade las menciones externas. Una entidad se consolida cuando aparece descrita igual en sitios que no controlas: notas de prensa, directorios sectoriales, perfiles de socios. Es lento, pero separa a la empresa que el modelo puede nombrar de la que solo describe en genérico.
Velocidad y rastreo: si no carga, no se indexa ni se cita
Ningún trabajo de estructura sirve si el rastreador no llega al texto. Los agentes de los modelos suelen ejecutar poco o nada de JavaScript: si tu contenido se pinta en el navegador después de cargar, para muchos de ellos tu página está vacía. Renderizado del lado del servidor o generación estática son la opción segura; compruébalo con JavaScript desactivado.
El resto es higiene: sitemap limpio, sin bloqueos accidentales, canonical autorreferente y tiempos de carga razonables. Un rastreador con presupuesto limitado visita menos páginas de un sitio lento. Si esa parte la tienes floja, empieza por por qué tu página web lenta te cuesta clientes antes de tocar el schema.
¿Cómo lo mido cuando Analytics no me lo muestra?
No hay un informe que diga «ChatGPT te citó 14 veces». Se mide con cuatro señales indirectas.
Rastrear referidos de chatgpt.com, perplexity.ai y gemini
Crea un segmento con los referidos de chatgpt.com, perplexity.ai, gemini.google.com y claude.ai. Espera volúmenes pequeños: ChatGPT concentra el 92,4% del tráfico referido por modelos de lenguaje, según los datos de Previsible publicados por Search Engine Land (2026).
Prueba manual mensual con captura fechada
Define cinco preguntas que un cliente haría de verdad, hazlas el mismo día de cada mes en cada asistente y guarda la captura con la fecha. Es la única evidencia directa de si te nombran y a quién nombran en tu lugar.
Search Console: impresiones estables con CTR cayendo
Compara impresiones y CTR por consulta. Si las impresiones se mantienen y el CTR baja sin que hayas perdido posición, lo más probable es que se haya activado un resumen de IA sobre esa consulta. Ese patrón te dice qué páginas priorizar.
Búsqueda de marca como indicador aguas abajo
Cuando un modelo te menciona, mucha gente no hace clic: busca tu nombre después. Un crecimiento sostenido de búsquedas de marca sin campañas activas indica que apareces en respuestas que no puedes ver.
Checklist de 12 puntos para aplicar en tu sitio
Ordenada de menor a mayor esfuerzo. Los ocho primeros los hace cualquiera con acceso al editor; los últimos requieren tocar plantilla o servidor.
- ☐ Reescribe el primer párrafo de tus cinco páginas más visitadas como respuesta directa.
- ☐ Convierte los H2 de esas páginas en preguntas completas.
- ☐ Elimina las aperturas de sección tipo «como vimos antes» y repite los sujetos.
- ☐ Añade fuente, año y enlace en la misma frase de cada cifra.
- ☐ Borra las cifras para las que no encuentres fuente verificable.
- ☐ Convierte en tabla HTML cada comparación escrita en párrafos.
- ☐ Añade una lista numerada de criterios o pasos por artículo.
- ☐ Escribe tres frases definicionales con la estructura «X es Y que sirve para Z».
- ☐ Unifica la descripción de tu empresa en web, LinkedIn y Google Business Profile.
- ☐ Revisa el
robots.txty decide qué rastreadores de IA permites. - ☐ Inyecta Article, FAQPage, Organization y BreadcrumbList, y valida el FAQ contra lo visible.
- ☐ Publica un
llms.txty comprueba que tu contenido se ve sin JavaScript.
Lo que NO funciona (y te van a intentar vender)
Todavía no contrates un servicio de GEO si tu sitio no está indexado, si no tienes contenido con datos propios o si tu tráfico orgánico no justifica defenderlo. Con el 0,14% del tráfico total viniendo de IA en 2025, según Semrush (2026), pagar una retención mensual por un canal que aún no te trae clientes es adelantar un gasto. Arregla primero indexación, velocidad y contenido: es lo mismo que necesitarías después.
Contenido masivo generado con IA sin datos propios. Publicar 40 artículos genéricos al mes no te hace citable: te hace redundante. El modelo ya sabe lo que dice ese texto. Lo que no tiene es tu precio real y tu plazo real.
Garantías de aparecer en ChatGPT. Nadie controla qué fuentes recupera un modelo, y las respuestas varían entre sesiones. Quien garantiza una mención garantiza algo que no depende de él.
Schema que no coincide con lo visible. Marcar preguntas que no existen en la página o rellenar FAQPage con keywords es spam de datos estructurados: se detecta y se sanciona.
Keyword stuffing en las FAQ. Repetir la keyword en cada pregunta empeora la extracción: dejan de parecerse a lo que la gente escribe en un chat. Escribe las preguntas reales de tus clientes.
Preguntas frecuentes
¿El SEO tradicional dejó de servir?
No. La búsqueda orgánica aportó el 16,04% del tráfico total mientras el tráfico de referencia de IA fue el 0,14%, según el estudio de Semrush (2026) sobre más de 50.000 sitios: el orgánico sigue siendo unas cien veces mayor. El GEO se monta sobre buen SEO, no lo reemplaza. Si tu página no está indexada ni responde la intención de búsqueda, ningún modelo la va a recuperar.
¿Qué es llms.txt y lo necesito?
El llms.txt es un archivo de texto plano en la raíz de tu dominio que sirve para darle a un modelo un mapa curado de tu sitio: quién eres, qué haces y cuáles son tus páginas importantes, en Markdown y sin menús ni banners. Es una propuesta comunitaria, no un estándar oficial, y su adopción por parte de los grandes modelos es desigual. Necesitarlo, no lo necesitas: cuesta media hora y no rompe nada.
¿Debo bloquear los rastreadores de IA?
Depende de tu modelo de negocio, y conviene decidirlo a conciencia. Si bloqueas GPTBot, PerplexityBot, ClaudeBot o Google-Extended en tu robots.txt, tu contenido no puede aparecer en las respuestas de esos sistemas: renuncias al canal completo. Bloquear tiene sentido si vendes el contenido en sí o si manejas información que no quieres ver reutilizada. Si tu contenido existe para atraer clientes, bloquear es cerrarte la puerta.
¿Cómo sé si ChatGPT está recomendando mi empresa?
Con dos métodos combinados. El primero es una prueba manual mensual: define cinco preguntas que un cliente haría de verdad, hazlas el mismo día de cada mes en cada asistente y guarda la captura fechada, anotando si te nombran y a quién nombran. El segundo es un segmento de referidos con chatgpt.com, perplexity.ai, gemini.google.com y claude.ai. Espera volúmenes bajos: ChatGPT concentra el 92,4% del tráfico referido por modelos de lenguaje, según Previsible, publicado por Search Engine Land (2026).
¿Sirve publicar contenido generado con IA?
Como borrador sí, como producto final no. Un texto generado sin información propia repite lo que el modelo ya sabe, así que no le aporta nada cuando construye una respuesta: no hay razón para citarte a ti en lugar de a la fuente original. Lo que sí se cita es lo que solo tú puedes aportar: precios de tu mercado, plazos medidos, errores que se repiten. Usa el modelo para redactar; los datos los pones tú.
¿Cuánto tarda en verse el efecto?
No existe una cifra pública fiable, y desconfía de quien te dé una. El plazo depende de tres factores que no controlas del todo: cada cuánto se rastrea tu sitio, cada cuánto se actualiza el índice del sistema que recupera fuentes y cuántas menciones externas consolidan tu entidad. El orden que sí puedes observar es: primero cambia tu página, después aparecen los referidos de asistentes, y por último cambia cómo te describen.
DINOLABS es una empresa colombiana que desarrolla páginas web, automatización de procesos y agentes de inteligencia artificial para empresas en Colombia, México, Estados Unidos y Suiza. Si quieres que revisemos tu sitio, agenda una asesoría estratégica.