Blog
Cómo hacer que ChatGPT recomiende tu negocio
Hay tres cambios técnicos concretos que aumentan las probabilidades de
que ChatGPT, Claude o Perplexity citen tu web: publicar un
llms.txt, marcar el contenido con datos estructurados
(schema.org) y permitir explícitamente a los rastreadores de IA en
robots.txt. Ninguno de los tres garantiza una mención:
son condición necesaria, no suficiente. Así es como funciona cada
uno.
¿Cómo elige un modelo de lenguaje qué web citar?
Un modelo como ChatGPT no «navega» tu web como lo haría una persona: cuando responde citando una fuente, lo hace a partir de contenido que ha podido rastrear y entender con claridad, o que su motor de búsqueda integrado recupera en el momento de responder. Dos condiciones previas deciden si tu web entra en ese conjunto: que el rastreador del modelo pueda acceder a tus páginas, y que el contenido esté escrito de forma que se pueda extraer una respuesta concreta sin tener que interpretar una página entera. Sin esas dos cosas, da igual lo buena que sea tu web: no hay nada que un modelo pueda citar con confianza.
¿Qué es llms.txt y para qué sirve?
llms.txt es un archivo de texto en la raíz del dominio,
pensado específicamente para modelos de lenguaje: en vez de que un
modelo tenga que rastrear e interpretar toda la web para entender qué
hace un negocio, llms.txt resume en texto plano qué es el
sitio, qué servicios ofrece y qué páginas son más relevantes para cada
pregunta habitual. Es el equivalente, para un modelo de lenguaje, a lo
que un mapa del sitio es para un buscador tradicional: no sustituye al
contenido real de las páginas, pero facilita muchísimo encontrarlo y
resumirlo bien.
¿Qué aportan los datos estructurados (schema.org)?
Schema.org es un vocabulario compartido para marcar, dentro del HTML, qué es cada cosa: que un precio es un precio, que una pregunta frecuente es una pregunta con su respuesta, que un artículo tiene un autor y una fecha de publicación. Un modelo de lenguaje —igual que un buscador— puede leer ese marcado sin tener que adivinar la estructura a partir del diseño visual de la página. La diferencia práctica es esta: un precio escrito solo como texto suelto en un párrafo es una cifra más entre muchas; un precio marcado con el tipo adecuado de schema.org es un dato que el modelo puede extraer con seguridad y atribuir correctamente a quien lo publica.
¿Por qué hay que tocar el robots.txt?
Por defecto, algunos rastreadores usados por herramientas de IA no
están permitidos en la configuración estándar de muchos sitios, o ni
siquiera se han tenido en cuenta al escribir el archivo. Si el
robots.txt de un sitio bloquea, expresamente o por
omisión, los rastreadores de OpenAI, Anthropic o Perplexity, ese
modelo nunca podrá indexar el contenido para citarlo, por muy bien
escrito que esté. Permitir esos rastreadores no es una promesa de
aparecer citado: es, simplemente, quitar el obstáculo que impide que
se pueda considerar la posibilidad.
¿Qué hace que un párrafo sea citable y no solo publicidad?
Estas son las diferencias concretas entre un contenido que un modelo trata como información y uno que trata como publicidad, y que este mismo blog intenta aplicar:
| Elemento | Contenido citable | Folleto publicitario |
|---|---|---|
| Primer párrafo | Responde la pregunta con un dato concreto desde la primera frase | Empieza con una frase de marca antes de decir nada útil |
| Cifras de mercado | Cita la fuente exacta junto al dato | Usa cifras sin origen o inventadas |
| Limitaciones | Explica cuándo NO conviene lo que vende | Solo enumera ventajas |
| Estructura | Títulos que son preguntas reales, tablas de datos | Titulares vagos, texto continuo sin datos |
¿Esto garantiza que ChatGPT recomiende mi negocio?
No, y cualquiera que lo prometa como un resultado garantizado no está
siendo honesto. Publicar llms.txt, marcar el contenido
con schema.org y permitir a los rastreadores de IA son condiciones
técnicas necesarias para que un modelo pueda citarte, no una garantía
de que lo haga: el modelo sigue decidiendo, para cada pregunta
concreta, qué fuentes le parecen más fiables y relevantes, y eso
depende también de la competencia, de la pregunta exacta que se haga
y de cambios en el propio modelo que nadie fuera de las empresas que
lo entrenan controla del todo. Lo que sí se puede afirmar, porque es
verificable, es que sin esas condiciones técnicas la probabilidad es
directamente nula: no se puede citar lo que no se puede rastrear ni
entender.
¿Qué se ha hecho concretamente en esta web?
Esta misma web de Zemog aplica los tres cambios de los que habla este
artículo: publica su propio llms.txt, marca sus páginas
con schema.org (precios, preguntas frecuentes y artículos, cada uno
con su tipo correspondiente) y su robots.txt permite
explícitamente a los rastreadores de OpenAI, Anthropic y Perplexity.
Además, páginas como esta se escriben siguiendo la misma tabla de la
sección anterior: la primera frase responde la pregunta del título con
una cifra, cada cifra de mercado cita su fuente junto al dato, y cada
artículo incluye una sección explícita sobre cuándo la opción que
vendemos no es la adecuada. No es una promesa de que esto vaya a
traducirse en menciones; es la descripción de un trabajo técnico
concreto, que cualquiera puede comprobar mirando el código fuente de
esta página.
¿Puedo aplicar esto a mi propia web?
Sí, y no exige rehacer la web entera: llms.txt y
robots.txt son archivos de texto que se pueden añadir a
cualquier sitio ya existente, y los datos estructurados se pueden
incorporar de forma incremental, página a página, empezando por las
que más interesa que un modelo entienda bien (precios, preguntas
frecuentes, artículos). El
servicio de SEO y
posicionamiento en buscadores de IA de Zemog incluye precisamente
esta preparación técnica, junto con el contenido escrito para
responder lo que la gente pregunta de verdad, con permanencia mínima
de tres meses porque antes no hay datos suficientes para saber si
algo está funcionando.
Si quieres que revisemos el estado actual de tu web en estos tres puntos, cuéntamelo en el formulario de contacto: te respondo en menos de 24 horas.