ChatGPT cita un sitio cuando puede comprobar, en segundos y sin ejecutar nada, que esa página responde exactamente la pregunta que le hicieron. Eso se descompone en cinco condiciones concretas: que el rastreador pueda entrar, que el contenido venga en el HTML, que la respuesta esté en el primer párrafo, que haya al menos un hecho que sólo publiques tú, y que exista una página por pregunta. Abajo está cada una, con la forma de comprobar si tu sitio la cumple hoy.

Primero: mencionar y citar no son lo mismo

Son dos cosas que en la conversación van juntas y en los datos no. Mencionar es que el modelo escriba tu nombre. Citar es que además enlace tu sitio como fuente de lo que acaba de decir. Lo primero es reputación; lo segundo deja un camino de vuelta y se puede medir en tu analítica.

Con FirmaWeb —un SaaS chileno de firma electrónica, primer cliente de kern.ia— medimos las dos por separado: 40% de visibilidad (la IA lo nombra en 10 de 25 preguntas reales de compra) y 96% de esas menciones citando además su sitio. La segunda cifra es la que manda en este artículo.

Una empresa puede tener mención alta y citación cero. Pasa cuando el modelo te conoce de su entrenamiento pero no encuentra una página tuya que respalde la frase que acaba de escribir: entonces te nombra y enlaza a otro. El enlace se lo lleva quien publicó la prueba.

1. Deja entrar al rastreador correcto

Antes de escribir una línea, revisa tu robots.txt. OpenAI usa tres agentes con trabajos distintos:

  • GPTBot — recopila contenido para entrenamiento.
  • OAI-SearchBot — alimenta el índice de búsqueda que ChatGPT consulta.
  • ChatGPT-User — va a buscar la página en el momento en que un usuario está esperando la respuesta.

Bloquear GPTBot y dejar pasar a los otros dos es una decisión legítima: no entrenar, pero sí ser citado. Bloquearlos a los tres porque copiaste un robots.txt de un artículo del año pasado no lo es. Es, de lejos, el error más caro y el más fácil de arreglar.

2. El contenido tiene que venir en el HTML

La mayoría de los rastreadores de IA no ejecuta JavaScript. Si tu página se dibuja en el navegador —un front que monta el texto después de cargar, un widget que inyecta las preguntas frecuentes, un CMS que trae el artículo por API— el rastreador recibe un esqueleto vacío y se va.

La comprobación es una línea en el terminal:

curl -sA "GPTBot" https://tusitio.cl/tu-pagina/ | grep "una frase literal de tu texto"

Si no devuelve nada, esa página no existe para ningún modelo, por buena que sea. Esto es también lo que hace inútil el atajo de "inyectar contenido citable con un script": el contenido tiene que venir en la respuesta del servidor.

3. La respuesta va en el primer párrafo

Un modelo con búsqueda activada no lee tu página como un lector: toma un fragmento y decide si le sirve. El patrón que funciona es simple y un poco antinatural para quien viene del marketing:

  1. La pregunta, tal como la escribiría el comprador, en el título.
  2. La respuesta completa —no un adelanto— en las primeras dos o tres líneas.
  3. Recién ahí el desarrollo, los matices y el contexto.

Al revés —introducción, historia de la empresa, contexto de mercado y la respuesta en el párrafo doce— es como se escribía para retener a un lector humano. Un modelo no se queda a esperar.

4. Un hecho que sólo puedas publicar tú

Acá se cae casi todo el contenido escrito con IA sin datos propios. Si tu página dice lo mismo que otras cuatro, el modelo elige la del dominio con más autoridad, y ese normalmente no eres tú. La única forma de ganar esa comparación es traer algo que las otras cuatro no tienen.

Sirve: un precio con número y moneda, un plazo, una norma con su número, una cifra propia medida, un caso con nombre y apellido, un límite declarado de tu propio producto. No sirve: "somos líderes", "la mejor opción del mercado", "años de experiencia".

Un hecho verificable también es el seguro contra la frase más cara del sector: un modelo que no encuentra el dato no lo deja en blanco, lo rellena. Publicarlo tú es la forma de elegir qué rellena.

5. Una página por pregunta

Una página larga que toca doce temas de refilón pierde contra doce páginas que responden un tema cada una. Un sitio que quiere ser citado termina pareciéndose más a un índice de respuestas que a un folleto, y eso es una decisión de arquitectura antes que de redacción.

Por qué el marcado, solo, no alcanza

Vale la pena decirlo porque es contraintuitivo y porque lo comprobamos midiendo, no leyéndolo: marcar el sitio con datos estructurados, por sí solo, no basta para que te citen. El JSON-LD sirve —le ahorra al modelo el trabajo de adivinar qué es cada cosa— pero es la etiqueta del frasco, no el contenido. Un frasco vacío bien etiquetado sigue vacío.

Cuál es el contenido que llena ese frasco en tu caso no se copia de nadie: depende de tu categoría, de tu comprador y de qué páginas están ocupando hoy la respuesta. Por eso este artículo entrega las condiciones y no un plan de contenidos — un plan escrito antes de medir es el plan de otra empresa.

Cómo comprobar si funcionó

Publicar no es aparecer. Una semana después, en una ventana nueva y sin historial, hazle al modelo la pregunta que tu página responde —con búsqueda activada, en español de Chile y nombrando el país— y anota tres cosas: si te nombró, cómo te describió y qué dominios citó. Repite en 30 días con las mismas preguntas. El paso a paso completo está en el método manual de 20 minutos.

Preguntas frecuentes

¿Cuánto demora en citarme una página nueva?

No hay un plazo garantizado, y conviene desconfiar de quien lo prometa. Lo que sí controlas es el descubrimiento: incluir la URL en el sitemap y avisar por IndexNow hace que Bing la conozca en minutos en vez de esperar semanas al rastreo. Que después el modelo la elija como fuente depende de que responda mejor que las páginas que hoy cita en tu lugar.

¿Sirve agregar un bloque de preguntas frecuentes con JSON-LD?

Sirve como complemento, no como sustituto. Repite en formato de datos lo que ya dice el texto; no aporta un hecho nuevo. Es barato y ordena, pero no reemplaza al contenido.

¿Me conviene bloquear GPTBot para que no entrene con mi contenido?

Es una decisión de negocio legítima y se puede tomar con precisión, agente por agente: bloquear GPTBot y permitir OAI-SearchBot y ChatGPT-User deja fuera el entrenamiento sin renunciar a la cita. Lo que no conviene es decidirlo por copiar el archivo de otro.

¿Esto es lo mismo que el SEO?

No. El SEO pelea una posición en una lista que el usuario todavía debe leer y comparar; acá el objetivo es estar dentro de la respuesta y que el enlace sea tuyo. Comparten la higiene técnica y se separan en la estructura del texto. Ver la guía completa de AEO en Chile.

Comprueba en qué preguntas te están reemplazando

Las cinco condiciones de arriba se pueden aplicar a mano. Lo que cuesta sostener es la otra mitad: saber en qué preguntas no apareces y qué dominios se llevan la cita en tu lugar, semana a semana. kern.ia lo mide por ti: conectas tu URL y el primer diagnóstico —claridad, visibilidad y los dominios que te reemplazan— llega en minutos. Cuenta gratis, sin tarjeta.