La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con las firmas de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos difundidos dentro de la línea de estudio centrada en Generative Engine Optimization (GEO) que Centria Group impulsa de la mano de diversas entidades universitarias y académicas de cuatro naciones.
El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.
«Por espacio de cerca de veinte años, la presencia en la red se evaluaba mediante una destreza muy específica: salir en un índice de opciones y recibir clics. Actualmente, las personas ya no se encuentran con diez vínculos azules; ahora obtienen una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El cuestionamiento fundamental ya no se centra en si mi dirección web figura y es seleccionada, sino en si mis materiales forman parte de la contestación que el consumidor verdaderamente visualiza», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.
«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.
Las cinco preguntas de investigación junto con sus respectivas respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Siete familias parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— sin ningún marco integrador compartido. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
No hay consenso: la unidad migra de la fuente/URL —herencia directa del SEO— hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, la trayectoria de navegación de agentes. Estudios con unidades distintas no son directamente comparables. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Solo una minoría aplica repetición o modelización explícita de la incertidumbre. La mayoría se apoya en una única ejecución o en acotar una ventana temporal, sin cuantificar la incertidumbre. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ningún estudio del corpus somete su instrumento a validación psicométrica. Existen controles adyacentes y aislados (estabilidad, fidelidad de la atribución, triangulación por diseño, robustez al orden). La fiabilidad intercodificadores apenas se reporta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
No. Los benchmarks evalúan la eficacia de tácticas o cambios de rango, no la validez de constructo de una medida; los estudios primarios operacionalizan métricas útiles pero parciales y sin fiabilidad documentada. |
Metodología: cuatro vías de búsqueda junto con una política clara de preprints
Cuatro vías complementarias integraron la búsqueda, ideadas para contrarrestar los puntos débiles de cada método: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias mediante nodos clave y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados por DOI —evitando el título debido a los frecuentes conflictos entre denominaciones genéricas dentro de esta disciplina—, dos evaluadores filtraron los registros analizando los resúmenes de manera autónoma, logrando acuerdos consensuados ante cualquier desacuerdo. Treinta y seis informes completos fueron valorados, seleccionándose veintitrés investigaciones principales, además de un par de revisiones catalogadas de forma independiente a modo de sustento teórico.
«Una gran porción del saber producido en español acerca de este tema no logra trascender hacia los circuitos globales. Rescatarlo va más allá de un asunto de mera exhaustividad: pone de manifiesto un sesgo idiomático subyacente en la disciplina», subrayó Néstor Romero.
Siete familias de métricas y ningún marco que las integre
El mapeo identifica siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que conviven sin un marco integrador compartido. El estudio destaca además que la frontera conceptual más fértil del campo es la distinción entre citación (que una fuente sea seleccionada) y absorción (que su contenido se incorpore efectivamente al texto de la respuesta), un desdoblamiento en dos capas de lo que antes se medía como un binario.
La unidad de análisis cambia de enfoque: pasa de la URL a la marca y a la trayectoria de los actores
No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.
Tipología de la evidencia disponible
|
Nivel de evidencia |
Ejemplos |
Peso en el corpus |
|
Benchmark de evaluación |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Dominante |
|
Medición primaria (motores reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Minoritaria |
|
Estudio aplicado / comercial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Limitada |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.
La inteligencia artificial no siempre contesta igual, y prácticamente nadie lo evalúa
Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.
«Dentro de este ámbito, registrar una única ejecución carece de solidez epistemológica. Todo instrumento fiable necesita integrar la repetición y el análisis de la incertidumbre como una exigencia fundamental, más allá de considerarlo un simple detalle opcional», puntualiza Romero.
El hallazgo central: un campo que mide mucho y valida poco
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Requisitos de admisión
|
Parámetro |
Adisión |
Descarte |
|
Enfoque |
Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas |
Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito |
|
Periodo |
2023-2026 (ámbito nativo digital) |
Previo a 2023 |
|
Idioma |
Castellano e inglés |
Idiomas restantes que carezcan de traducción accesible |
|
Clasificación |
Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas |
Artículos de opinión, editoriales y material de índole comercial |
|
Condición |
Se aceptan preprints conforme a los criterios de sensibilidad establecidos |
Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Hallamos un sector donde abunda la medición y escasea la validación. Las propuestas de evaluación no escasean —de hecho, sobran—; lo que realmente escasea es la fiabilidad documentada y la validez de constructo. Y es preciso señalarlo con rigor, pues equiparar un simple benchmark con un instrumento debidamente validado eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.
Una brecha entre la práctica profesional y la academia
El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.
«a visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».
«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
Asimismo, este análisis arroja una aportación metodológica de notable interés para el ámbito hispanohablante. Hay un corpus de estudios en castellano, difundido en publicaciones de Biblioteconomía y Documentación, que examina la visibilidad frente a la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas en las sugerencias de viajes elaboradas por IA, o el ajuste de archivos académicos para facilitar su indexación por parte de motores generativos—, aspectos que los textos en inglés suelen omitir. Dicha literatura únicamente pudo recuperarse a través de consultas en múltiples idiomas, lo que pone de manifiesto un sesgo idiomático implícito en esta disciplina.
A esto se añade una segunda enseñanza derivada del propio procedimiento: el cotejo en una base indexada arrojó 360 entradas en bruto, de las cuales se examinaron las 136 disponibles en abierto —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna nueva investigación válida de medición. En resumen, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura insuficiente en los índices convencionales; de hecho, el 64 % de los textos preliminares se divulga mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso de elección de estudios (PRISMA-ScR, dos ramas)
|
Fase |
Desenlace |
|
Rama de descubrimiento (Consensus) |
Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo |
|
Rama de otros métodos |
Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra |
|
Verificación en Web of Science |
Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional |
|
Evaluación a texto completo |
Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia |
|
Inclusión final |
Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado son firmes; las de evaluación a texto completo e inclusión, provisionales, según declaran los autores.
Se puede manipular la visibilidad generativa
Un subconjunto de los trabajos revisados demuestra que la visibilidad en motores generativos es manipulable de forma adversarial, mediante técnicas de manipulación del ranking en buscadores conversacionales o mediante optimización sigilosa de prompts. El estudio traslada esa evidencia al terreno de la medición: la robustez frente a la manipulación debería formar parte de las propiedades exigibles a cualquier instrumento de presencia.
«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».
«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».
Qué viene ahora: del diagnóstico al instrumento
Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.
«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.
Limitaciones declaradas por los autores
El texto deja claros sus propios confines: la fragilidad de los datos en un ámbito tan incipiente y plagado de preprints, lo cual vuelve provisionales sus deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de referencias y el cotejo indexado—; la acotada cobertura idiomática al inglés y al español junto a la carencia de acceso institucional para constatar en Scopus; el etiquetado efectuado de manera parcial sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propia ejecución; y la caducidad temporal intrínseca a cualquier análisis de un sector fundamentado en tecnologías propietarias en mutación constante.
Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».
