Por qué la IA te recomienda un día y al siguiente no

Le preguntas a ChatGPT qué agencia le recomienda en tu ciudad y sale tu empresa. Se lo enseñas a un compañero, lo prueba, y no sale. No has hecho nada raro y ninguno de los dos se ha equivocado: los modelos de lenguaje no son deterministas.

Esto, que parece un detalle técnico, es la razón por la que la mayoría de las comprobaciones de visibilidad en IA que se hacen por ahí no valen para nada.

Por qué la misma pregunta da respuestas distintas

Un modelo no busca en una tabla y te devuelve una fila. Genera texto palabra a palabra eligiendo, en cada paso, entre varias opciones probables. Esa elección lleva un componente aleatorio deliberado —el que hace que las respuestas suenen naturales y no a plantilla—, y basta con que cambie una palabra al principio para que el resto de la respuesta se desvíe.

Encima se suman otras tres fuentes de variación:

  • La búsqueda web. Si el modelo consulta internet, los resultados que encuentra hoy no son los de ayer.
  • La versión del modelo. Los proveedores actualizan sin avisar. Una respuesta de marzo y otra de agosto pueden venir de modelos distintos.
  • El contexto. La conversación previa, el historial y hasta el país desde el que preguntas alteran el resultado.

Qué significa esto para tu marca

Que una comprobación suelta no dice nada. Si preguntas una vez y sales, no sabes si sales el 90% de las veces o has tenido suerte. Si preguntas una vez y no sales, tampoco sabes si estás fuera o te ha tocado la respuesta en la que no cabías.

El error se multiplica cuando alguien compara meses: «en julio salíamos y en agosto no». Sin repeticiones, esa frase no tiene contenido. La mitad de esa diferencia puede ser ruido del modelo.

Cómo se mide bien: tres decisiones

1. Repetir cada pregunta

Cada prompt se lanza al menos tres veces por motor y se trabaja con la media. Es la corrección más importante y la que casi nadie aplica. Sin ella estás facturando azar como si fuera resultado.

2. Congelar el set de preguntas

Un conjunto fijo de preguntas —nosotros usamos 20 por cliente— que no se toca en seis meses. En cuanto cambias un prompt, el mes anterior deja de ser comparable. Si hay que cambiarlo, se versiona y se anota la fecha en el informe.

3. Registrar la versión del modelo

En cada consulta se guarda qué modelo exacto la respondió. Si OpenAI cambia de versión y tus números se mueven, eso no es tu estrategia, y tienes derecho a que te lo digan así.

Y una regla más: no nombres tu marca

Si preguntas «¿qué te parece mi empresa?», el modelo va a hablar de tu empresa. Eso no mide visibilidad, mide su capacidad de leer tu web. Lo que importa es si te nombra cuando el cliente todavía no te conoce: «¿qué agencia de marketing industrial me recomiendas en Bizkaia?».

Por eso, en nuestro GEO Checker, en cuatro de las siete preguntas está prohibido mencionar la marca. Son las que valen 75 de los 100 puntos del score.

Qué hacer si tu visibilidad es inestable

La inestabilidad tiene cura, y no es rezar. Un modelo te nombra de forma consistente cuando encuentra señales repetidas y coherentes sobre ti en muchas fuentes: tu web, directorios, prensa, reseñas, menciones de terceros. Cuando la señal es débil, el modelo te incluye o no según le sople el muestreo.

Dicho de otro modo: la varianza es un síntoma. Si sales el 30% de las veces, el trabajo no es «salir siempre», es reforzar las fuentes hasta que salir sea lo probable.

Puedes ver cómo medimos el GEO —las ocho métricas, con su fórmula— y en qué consiste nuestro servicio de agencia GEO en Bilbao.

Preguntas frecuentes

¿Cuántas veces hay que repetir cada pregunta?

Tres por motor es el mínimo razonable para amortiguar el azar sin disparar el coste. Con una sola pasada, buena parte de la variación mensual es ruido.

¿Poner la temperatura a cero soluciona la variabilidad?

Ayuda si consultas por API, pero no reproduce lo que ve un cliente real: la gente usa la interfaz normal, con búsqueda web y su propio contexto. Medir en condiciones de laboratorio da un número más estable y menos parecido a la realidad.

¿Influye el historial de mi cuenta de ChatGPT?

Sí. Si has hablado antes de tu empresa, el modelo puede tenerlo en cuenta. Para medir hay que hacerlo en sesiones limpias, sin historial y sin personalización.

¿Salir el 100% de las veces es posible?

En consultas muy concretas y sectores pequeños, sí. En consultas genéricas con muchos competidores, no: el modelo solo cita a unos pocos y el objetivo realista es subir tu probabilidad de estar entre ellos.

¿Cada cuánto conviene medir?

Una vez al mes, siempre el mismo día y con el mismo set. Más a menudo captura ruido; menos a menudo se pierde la relación entre lo que hiciste y lo que pasó.