La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con las firmas de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos difundidos dentro de la línea de estudio centrada en Generative Engine Optimization (GEO) que Centria Group impulsa de la mano de diversas entidades universitarias y académicas de cuatro naciones.
Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión científica: al sugerir un hotel, una póliza de seguros o una entidad financiera un asistente de inteligencia artificial, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán fiable resulta? Con el fin de despejar esta incógnita, los investigadores llevaron a cabo una revisión exhaustiva basada en la metodología del Joanna Briggs Institute (JBI), ajustándose además a la directriz PRISMA-ScR; de este modo, se traza un mapa sistemático sobre la forma en que los estudios recientes cuantifican la visibilidad, las menciones y el posicionamiento de marcas y fuentes dentro de los sistemas conversacionales.
«Casi veinte años atrás, la presencia en el entorno digital dependía de una destreza muy específica: figurar, y recibir clics, en un índice de resultados. En la actualidad, el internauta ya no se topa con diez vínculos azules, sino que obtiene una contestación elaborada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El dilema central ya no radica en si nuestro hipervínculo sale y es accionado, sino en si la información se integra en la contestación que la persona efectivamente visualiza», señala Néstor Romero, investigador firmante del informe y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El artículo parte de una constatación que el propio corpus revisado respalda con evidencia empírica: las fuentes citadas por un motor generativo coinciden escasamente con aquellas que posicionan en el buscador tradicional, mientras que la lógica de selección cambia de una plataforma a otra. Dicho de otro modo, aparecer en Google no garantiza visibilidad en un asistente conversacional, lo que descarta la transferencia directa de métricas y exige replantear tanto los indicadores como los métodos de medición. A lo anterior se añade el fenómeno «cero clics», impulsado por los resúmenes generativos que ya incorporan los buscadores: hoy en día, un porcentaje considerable de las búsquedas se satisface sin que el usuario llegue a navegar por ninguna página web.
«La tasa de citación figura como el indicador principal en el ejercicio profesional, mientras que los textos académicos la reducen a una sola investigación. Dicha distancia entre la teoría y el sector laboral constituye un descubrimiento por derecho propio», afirmó Néstor Romero.
Las cinco preguntas de investigación junto con sus respectivas respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Se utilizan siete conjuntos de indicadores que se superponen parcialmente —aparición/citación, relevancia/ubicación, absorción/impacto, posición en clasificaciones, consistencia, tono/encuadre y proporción de citas—, careciendo de un marco unificador común. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
Falta unanimidad: el objeto de estudio se desplaza desde el origen o URL —herencia clásica del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, el recorrido de navegación de los agentes. Aquellos análisis con elementos distintos no resultan directamente comparables. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Tan solo una pequeña parte implementa réplicas o un tratamiento formal de la aleatoriedad. La mayor parte recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición del margen de error. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ninguna investigación de la muestra somete su herramienta a contrastación psicométrica. Se observan supervisiones colaterales y fragmentadas (consistencia, precisión en la autoría, triangulación metodológica, resistencia frente al orden). El grado de acuerdo entre evaluadores rara vez se documenta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la validez conceptual de un índice; los trabajos originales desarrollan parámetros prácticos pero incompletos y carentes de fiabilidad comprobada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.
«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
En el mapeo se distinguen siete grupos de métricas con ciertos solapamientos —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— que operan careciendo de un esquema unificador común. Asimismo, la investigación subraya que el límite conceptual más productivo dentro de esta disciplina radica en separar la citación (el hecho de que se elija una fuente) de la absorción (la asimilación real de su contenido en el texto resultante), dividiendo de este modo en dos planos lo que anteriormente se evaluaba como una simple dicotomía.
La unidad de análisis cambia: de la URL a la marca y a la trayectoria de los agentes
Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran un cambio paulatino que va desde la procedencia o la dirección web (como legado clásico del posicionamiento web) hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, hacia elementos más amplios como los recorridos de navegación de los usuarios. Dicha evolución evidencia el traslado del interrogante dentro de este ámbito, aunque esto conlleva un precio: las investigaciones basadas en elementos diferentes no se pueden contrastar de forma directa, lo cual consolida la imposibilidad de llevar a cabo un metaanálisis.
Clasificación de los datos probatorios accesibles
| Grado de evidencia | Casos prácticos | Proporción en el corpus |
| Benchmark de evaluación | GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) | Predominante |
| Medición primaria (motores reales) | How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) | Escasa |
| Estudio aplicado / comercial | GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) | Restringida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La Inteligencia Artificial no contesta de forma idéntica todo el tiempo, y prácticamente nadie evalúa este fenómeno
Los motores generativos poseen un carácter estocástico, lo que significa que arrojan resultados diferentes frente a una misma consulta. Por consiguiente, una evaluación fidedigna requiere replicar las pruebas o representar formalmente la incertidumbre; no obstante, una escasa proporción de las investigaciones adopta este enfoque de manera metódica. Entre los pocos casos que lo implementan sobresalen iniciativas que realizan cinco corridas por pregunta, 200 valoraciones acompañadas de permutaciones secuenciales, pruebas de sensibilidad lingüística y de reformulación, o bien enfoques donde la visibilidad se concibe como un espectro probabilístico en vez de una cifra aislada. En contraste, el grueso de los análisis restantes se conforma con una sola ejecución.
«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el inicio, y no como un simple añadido», apunta Romero.
El descubrimiento principal: un terreno que mide en exceso y verifica de forma escasa
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Criterios de elegibilidad
|
Parámetro |
Adisión |
Descarte |
|
Enfoque |
Cuantificación u operacionalización del impacto, la presencia, las menciones o la visibilidad dentro de los motores generativos |
Posicionamiento tradicional en buscadores, diseño asistido por computadora (CAD), redes generativas antagónicas (GAN), motores de recomendación y aplicaciones ajenas a este ámbito |
|
Rango temporal |
2023-2026 (ámbito de nacimiento digital) |
Precedente al año 2023 |
|
Lengua |
Castellano e inglés |
Idiomas restantes que carezcan de traducción accesible |
|
Clasificación |
Investigación empírica de medición, evaluación comparativa o trabajo práctico dotado de métricas |
Artículos de opinión, editoriales y material comercial o publicitario |
|
Condición |
Preprints aceptados conforme a los criterios de sensibilidad |
Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Encontramos un campo que mide mucho y valida poco. Lo que falta no son ideas de medición, que abundan: lo que falta es validez de constructo y fiabilidad documentada. Y conviene decirlo con precisión, porque confundir un benchmark con un instrumento validado infla la aparente madurez metodológica del campo. Ese vacío es, exactamente, la oportunidad científica», afirma Néstor Romero.
Una distancia considerable entre la praxis profesional y la academia
El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.
«La visibilidad en Google no anticipa la presencia en un asistente generativo. Esto anula la transferencia directa de métricas y obliga a replantearse qué evaluamos y de qué manera».
«La visibilidad generativa es manipulable, y esto traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
Asimismo, este análisis arroja una aportación metodológica de notable interés para el ámbito hispanohablante. Hay un corpus de estudios en castellano, difundido en publicaciones de Biblioteconomía y Documentación, que examina la visibilidad frente a la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas en las sugerencias de viajes elaboradas por IA, o el ajuste de archivos académicos para facilitar su indexación por parte de motores generativos—, aspectos que los textos en inglés suelen omitir. Dicha literatura únicamente pudo recuperarse a través de consultas en múltiples idiomas, lo que pone de manifiesto un sesgo idiomático implícito en esta disciplina.
A esto se añade otra enseñanza derivada del procedimiento: la búsqueda en un repositorio indexado arrojó 360 resultados preliminares, de los cuales se analizaron los 136 disponibles en abierto —en su mayor parte interferencias temáticas debido a coincidencias terminológicas—, sin que se sumara ninguna nueva investigación evaluable. En pocas palabras, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura deficiente en los índices convencionales; el 64 % del conjunto inicial se publica mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Flujo de selección de estudios (PRISMA-ScR, dos ramas)
|
Fase |
Desenlace |
|
Rama de descubrimiento (Consensus) |
Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo |
|
Rama de otros métodos |
Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra |
|
Verificación en Web of Science |
Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional |
|
Evaluación a texto completo |
Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia |
|
Inclusión final |
Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.
La visibilidad generativa es susceptible de manipulación
Un conjunto de los análisis examinados evidencia que la visibilidad dentro de los motores generativos resulta alterable de manera adversarial, ya sea recurriendo a procedimientos de manipulación de posiciones en buscadores conversacionales o a través de una optimización encubierta de prompts. Dicha investigación traslada semejantes datos al ámbito de la medición, concluyendo que la solidez ante cualquier intento de alteración tendría que integrarse entre las características indispensables de toda herramienta de visibilidad.
«Una prueba de rendimiento comprueba si una estrategia resulta eficaz o si un elemento varía de posición, pero no determina si un indicador mide adecuadamente un constructo. Mezclar ambos planos magnifica el grado de desarrollo ficticio de la disciplina».
«En este ámbito, evaluar un único intento resulta epistemológicamente endeble; los sistemas generativos son capaces de ofrecer respuestas diferentes ante idéntica consulta».
Qué viene ahora: del diagnóstico al instrumento
Los autores concluyen que el vacío detectado —en validez de constructo y en fiabilidad documentada— constituye la apertura que justifica desarrollar y validar formalmente un índice específico de presencia generativa, y sitúan esa tarea como la continuación natural del trabajo publicado, y no como una afirmación ya demostrada. Es precisamente la línea en la que el equipo trabaja en la fase siguiente.
«Nuestro objetivo es pasar del diagnóstico a la herramienta: construir y validar un índice que cualquier organización, del tamaño que sea, pueda usar para saber con base científica qué presencia tiene su marca cuando la inteligencia artificial responde por ella», adelanta Néstor Romero.
Limitaciones declaradas por los autores
El texto deja claros sus propios confines: la fragilidad de los datos en un ámbito tan incipiente y plagado de preprints, lo cual vuelve provisionales sus deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de referencias y el cotejo indexado—; la acotada cobertura idiomática al inglés y al español junto a la carencia de acceso institucional para constatar en Scopus; el etiquetado efectuado de manera parcial sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propia ejecución; y la caducidad temporal intrínseca a cualquier análisis de un sector fundamentado en tecnologías propietarias en mutación constante.
Estas restricciones resultan esenciales para interpretar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».


