Logotipo

Artículo Original

Gobernanza ética y rediseño evaluativo del aprendizaje ante la IA generativa en la educación superior

Ethical Governance and Evaluative Redesign of Learning amid Generative AI in Higher Education



Olga Marisol Bravo Santos 1 *

email olga.bravos1@ug.edu.ec

orcid-black https://orcid.org/0000-0002-3695-6878

Alejandra Elizabeth Garcia Suarez 2

email alejandra.garcias@ug.edu.ec

orcid-black https://orcid.org/0000-0001-5358-4423

Carolina Maritza Mendoza Campelo 3

email carolina.mendozaca@ug.edu.ec

orcid-black https://orcid.org/0009-0003-5134-2027


institution1 Universidad de Guayaquil. Guayaquil, Ecuador.


*Autor para correspondencia: Olga Marisol Bravo Santos, email: olga.bravos1@ug.edu.ec.


Cita sugerida (APA, séptima edición)

Bravo Santos, O. M., Garcia Suarez, A. E., Mendoza Campelo, C. M. (2026). Gobernanza ética y rediseño evaluativo del aprendizaje ante la IA generativa en la educación superior. Universidad y Sociedad 18(4). e6098.


Resumen:

La irrupción de la inteligencia artificial generativa (IAG) en la educación superior ha tensionado los mecanismos tradicionales de evaluación del aprendizaje y de salvaguarda de la integridad académica. Ante la evidencia de la ineficacia de las políticas basadas exclusivamente en la detección algorítmica, el presente estudio se propuso analizar críticamente el estado del arte sobre estrategias de gobernanza ética y rediseño evaluativo. Mediante una revisión sistemática de literatura guiada por la declaración PRISMA 2020, se analizaron 18 estudios empíricos publicados entre 2025 y 2026 en Scopus, WoS, SciELO y Dialnet. Los resultados confirman la obsolescencia del paradigma punitivo y documentan la eficacia de marcos de integración transparentes como la Escala de Evaluación de IA (AIAS) y de evaluaciones centradas en procesos cognitivos auténticos. En el contexto iberoamericano, destaca el modelo MAC-HIA como propuesta de adaptabilidad curricular orquestada por IA con enfoque inclusivo. Se concluye que la sostenibilidad de la evaluación universitaria exige transitar de la detección del fraude al diseño pedagógico de tareas resilientes, sustentado en un nuevo contrato de gobernanza ética que establezca los niveles permitidos de asistencia algorítmica.

Palabras clave: Inteligencia Artificial Generativa, Integridad Académica, Evaluación del Aprendizaje, Educación Superior, Gobernanza Ética.


Abstract:

The emergence of generative artificial intelligence (GAI) in higher education has strained traditional learning assessment mechanisms and academic integrity safeguards. Given the evidence of the ineffectiveness of policies based solely on algorithmic detection, this study aimed to critically analyze the state of the art regarding ethical governance strategies and assessment redesign. Through a systematic literature review guided by the PRISMA 2020 statement, 18 empirical studies published between 2025 and 2026 in Scopus, WoS, SciELO, and Dialnet were analyzed. The results confirm the obsolescence of the punitive paradigm and document the effectiveness of transparent integration frameworks such as the AI Assessment Scale (AIAS) and assessments focused on authentic cognitive processes. In the Ibero-American context, the MAC-HIA model stands out as a proposal for AI-orchestrated curricular adaptability with an inclusive approach. It is concluded that the sustainability of university assessment requires a shift from fraud detection to the pedagogical design of resilient tasks, supported by a new ethical governance contract that makes explicit the permitted levels of algorithmic assistance.

Keywords: Generative Artificial Intelligence, Academic Integrity, Learning Assessment, Higher Education, Ethical Governance.



Recibido: 4 febrero del 2026

Aceptado: 8 de julio del 2026



Introducción



La irrupción de la inteligencia artificial generativa (IAG) en el ecosistema educativo ha desencadenado una transformación de alcance y velocidad sin precedentes en la historia reciente de la educación superior. Herramientas como ChatGPT, Gemini, Claude y otros modelos de lenguaje de gran escala (LLM, por sus siglas en inglés) han pasado, en apenas tres años, de ser una curiosidad tecnológica a convertirse en un recurso de uso cotidiano entre el estudiantado universitario. Esta rápida adopción, documentada en estudios empíricos recientes, revela que más del 60 % de los estudiantes de educación superior utilizan regularmente algún tipo de IAG para apoyar sus tareas académicas (Vásquez et al. 2025). Tal ubicuidad ha situado a las universidades ante una encrucijada: ¿cómo preservar la validez y la equidad de la evaluación del aprendizaje en un contexto donde la frontera entre la autoría humana y la generación algorítmica se ha vuelto cada vez más difusa?

La literatura especializada coincide en señalar que la IAG no constituye simplemente una herramienta más de asistencia al aprendizaje, sino un fenómeno disruptivo que cuestiona los fundamentos mismos de la integridad académica (Bittle y El-Gayar, 2025). A diferencia de las formas tradicionales de deshonestidad académica (como el plagio textual o la suplantación de identidad), el uso indebido de la IAG introduce una ambigüedad normativa y ética que los marcos regulatorios vigentes no estaban preparados para gestionar. Los estudiantes pueden recurrir a estas tecnologías para generar ensayos completos, resolver problemas complejos o simular razonamientos críticos, a menudo sin una comprensión clara de dónde se sitúa el límite entre la asistencia legítima y el fraude académico (Daluma y Aclao, 2026; Shishakly y Nachouki, 2026).

Esta situación ha generado una respuesta institucional que, en muchos casos, ha privilegiado un enfoque reactivo centrado en la detección. Universidades de todo el mundo han implementado software especializado (como Turnitin AI, GPTZero o Copyleaks) con la expectativa de identificar y sancionar el contenido generado por IA (Deep et al., 2025). Sin embargo, la evidencia empírica acumulada cuestiona seriamente la eficacia y la equidad de esta estrategia: los detectores de IA presentan tasas inaceptables de falsos positivos, afectan desproporcionadamente a estudiantes no nativos en inglés y carecen de la transparencia necesaria para sustentar decisiones académicas con consecuencias graves (Hardie et al., 2025). En consecuencia, instituciones de referencia como la Universidad de Ciudad del Cabo (UCT) han optado por descontinuar oficialmente el uso de estas herramientas, reconociendo que erosionan la confianza estudiantil y desvían la atención del verdadero problema pedagógico (UCT News, 2025).

Frente a las limitaciones del enfoque punitivo, un cuerpo creciente de investigación educativa propone un cambio de paradigma: transitar desde la detección del fraude algorítmico hacia el rediseño estructural de las prácticas de evaluación. Esta perspectiva, articulada conceptualmente por autores como Chapman y Dalgarno (2025) bajo el lema "Beyond the ban", sostiene que la sostenibilidad de la integridad académica en la era de la IAG depende menos de la sofisticación de los detectores que de la robustez del diseño pedagógico y la claridad del marco ético institucional.

En esta línea, marcos aplicados como la Escala de Evaluación de IA (AIAS) han demostrado empíricamente que la explicitación transparente de los niveles de uso permitido de IAG en cada tarea reduce significativamente los comportamientos oportunistas y mejora la percepción de justicia evaluativa (Furze et al., 2024; Perkins et al., 2025). De manera complementaria, investigaciones recientes evidencian que las evaluaciones centradas en la validación de procesos cognitivos (tales como la resolución de problemas contextualizados, la reflexión metacognitiva o las defensas orales) resultan notablemente más resilientes frente al reemplazo por LLM que los exámenes factuales o los ensayos genéricos (Peters y Angelov, 2025; Ncube et al., 2025).

A pesar de la abundante producción científica sobre IAG y educación superior en el ámbito anglosajón, el contexto iberoamericano presenta particularidades que merecen una atención específica. Por un lado, las universidades de la región enfrentan un rezago considerable en la actualización de sus normativas de convivencia académica, las qu carecen, en su mayoría, de tipificaciones claras sobre los distintos niveles de uso asistido por IA (Jiménez y Cisneros, 2026). Por otro lado, este mismo rezago ofrece una oportunidad para que las instituciones iberoamericanas no se limiten a replicar modelos importados, sino que desarrollen marcos de gobernanza ética adaptados a sus realidades socioculturales y a sus tradiciones pedagógicas.

En este sentido, el reciente informe de la Organización de Estados Iberoamericanos (OEI), "La llegada de la IA a la educación superior en Iberoamérica", subraya la urgencia de diseñar estrategias institucionales que articulen la formación docente, la actualización normativa y el rediseño evaluativo como ejes interdependientes de una respuesta integral al desafío de la IAG (Rivas, 2025). Asimismo, revisiones sistemáticas centradas específicamente en la producción científica iberoamericana revelan que, si bien existe una creciente preocupación por los aspectos éticos y la integridad académica, los estudios empíricos sobre estrategias de evaluación alternativas en la región son aún incipientes (Silgado-Tuñón y López-Flores, 2025).

La presente revisión sistemática de literatura se inserta precisamente en esta intersección crítica: la necesidad de construir, a partir de la mejor evidencia empírica disponible, un marco comprensivo que oriente a las universidades (y particularmente a las iberoamericanas) en la transición desde un modelo reactivo de control hacia un modelo proactivo de gobernanza ética y rediseño pedagógico.

En consecuencia, este estudio se propone responder a dos preguntas de investigación interrelacionadas:

Para garantizar el rigor y la transparencia en la consecución de estos objetivos, la investigación se ha estructurado bajo las directrices de la declaración PRISMA 2020 (Page et al., 2021), asegura así la trazabilidad y reproducibilidad del proceso de búsqueda, cribado y síntesis de la evidencia.

El resto del artículo se organiza de la siguiente manera: la Sección 2 detalla los materiales y métodos empleados, con la inclusión de la estrategia de búsqueda y los criterios de elegibilidad. La Sección 3 presenta los resultados del análisis temático del corpus seleccionado. La Sección 4 discute los hallazgos a la luz de los marcos teóricos vigentes y las implicaciones para la gobernanza institucional. Finalmente, la Sección 5 sintetiza las conclusiones principales y esboza una agenda para la investigación futura.



Materiales y métodos



El presente estudio se desarrolló bajo un enfoque cualitativo y descriptivo, estructurado mediante una Revisión Sistemática de Literatura (RSL). Con el propósito de garantizar la transparencia, reproducibilidad y el rigor metodológico exigido en la investigación educativa contemporánea, el proceso de búsqueda, cribado y selección documental se apegó estrictamente a las directrices de la declaración PRISMA 2020 (Preferred Reporting Items for Systematic reviews and Meta-Analyses).

Preguntas de investigación


Para guiar sistemáticamente la indagación documental y responder a las necesidades del contexto universitario iberoamericano, se definieron dos preguntas de investigación (PI):

Estrategia de búsqueda y fuentes de información

La recopilación bibliográfica se ejecutó durante el mes de marzo de 2026. Dada la naturaleza global y regional del fenómeno, se seleccionaron cuatro bases de datos de alto impacto en Ciencias Sociales y Educación: Scopus y Web of Science (WoS) para la literatura de corriente principal, junto con SciELO y Dialnet para asegurar la representatividad de la producción científica en español y el contexto iberoamericano.

Se configuró una ecuación de búsqueda combinando operadores booleanos (AND, OR) adaptada a la sintaxis de cada plataforma: (“Generative AI” OR “ChatGPT” OR “LLM”) AND (“Academic integrity” OR “Assessment” OR “Evaluation”) AND (“Higher education” OR “University”). En Dialnet y SciELO se utilizaron los términos equivalentes en español.

Criterios de elegibilidad

Para acotar el corpus a un volumen manejable y de alta calidad empírica, se establecieron los siguientes parámetros:

Aunque la ventana de búsqueda se extendió desde enero de 2023, todos los estudios que superaron los filtros de calidad y los criterios de inclusión se concentran en el bienio 2025-2026, reflejo de la maduración reciente de la investigación empírica sobre IA generativa e integridad académica.

Proceso de selección y extracción de datos

El flujo de trabajo documental se gestionó de manera sistemática. Tras la exportación de los resultados iniciales, se eliminaron los registros duplicados. Posteriormente, dos investigadores revisaron de forma independiente los títulos y resúmenes para descartar aquellos que no cumplían con los criterios temáticos. Los documentos preseleccionados fueron sometidos a una lectura a texto completo. En caso de discrepancia sobre la inclusión de un artículo, se resolvió mediante consenso. Finalmente, la información de los artículos seleccionados se volcó en una matriz de extracción de datos que categorizó: autor, año, metodología, contexto geográfico, herramientas de IA analizadas y estrategias de evaluación propuestas. Todo el proceso de depuración se ilustra en el diagrama de flujo correspondiente en la Figura 1.


Fig 1. Diagrama de flujo del proceso de selección de estudios según la declaración PRISMA 2020



Resultados y discusión



El proceso de revisión sistemática, conducido conforme a las directrices PRISMA 2020, resulta en la inclusión final de 18 estudios empíricos publicados entre 2025 y 2026. El análisis de contenido de este corpus revela tres ejes temáticos interdependientes que estructuran la evidencia actual sobre la IA generativa (IAG) en la evaluación universitaria.

Caracterización del Corpus Analizado

Los 18 artículos seleccionados presentan una marcada diversidad geográfica y metodológica, aunque con un claro predominio del contexto anglosajón e iberoamericano (n=14). Desde el punto de vista del diseño de investigación, se identifica una mayoría de estudios con metodología mixta (n=8), seguidos de estudios puramente cualitativos basados en análisis temático o estudios de caso (n=6) y cuantitativos con base en encuestas a gran escala (n=4). La herramienta de IAG más referenciada en el corpus es ChatGPT (OpenAI), citada explícitamente en 17 de los 18 estudios, lo que confirma su centralidad en el debate académico actual.

Evidencias del Impacto de la IA Generativa en la Integridad Académica

El análisis de los siete estudios correspondientes al Bloque 1 confirma que la IAG ha dejado de ser una amenaza potencial para convertirse en una realidad operativa que tensiona los marcos normativos tradicionales de la integridad académica.

Prevalencia y normalización del uso indebido:

Los hallazgos de Hardie et al. (2025), derivados de un estudio a gran escala en The Open University, evidencian que, si bien la detección algorítmica del plagio de IA es técnicamente inconsistente, la percepción estudiantil sobre la facilidad para eludir los controles es alta. Este dato se correlaciona con el estudio de Vásquez et al. (2025), quienes reportan una brecha significativa entre el uso instrumental de ChatGPT (declarado por más del 60% de los estudiantes encuestados) y la comprensión normativa de los límites éticos de dicho uso.

Disonancia ética y percepción de riesgo:

Shishakly y Nachouki (2026) identifican un patrón recurrente en estudiantes universitarios de pregrado: la disonancia entre la condena teórica del "plagio algorítmico" y la justificación pragmática del "uso como asistente de escritura". Complementariamente, Kanashina (2026) demuestra empíricamente que una mayor conciencia sobre los riesgos de plagio no se traduce necesariamente en una disminución del uso no ético, sino en una mayor sofisticación en las técnicas de paráfrasis automatizada. En la misma línea, Obed et al. (2025) advierten que incluso los futuros docentes (estudiantes de magisterio) muestran una preparación deficiente para discernir entre la colaboración legítima con la IA y la deshonestidad académica en las tareas de evaluación.

Mapeo del fenómeno:

El análisis bibliométrico de Daluma y Aclao (2026) confirma que la producción científica sobre Integridad Académica e IAG ha crecido exponencialmente, pero señala una saturación temática en la "detección" y un déficit significativo de estudios sobre "prevención pedagógica" y "gobernanza", hallazgo que justifica precisamente el enfoque del presente artículo.

Estrategias Pedagógicas y Rediseño de la Evaluación

Frente al diagnóstico anterior, los siete estudios del Bloque 2 documentan empíricamente un cambio de paradigma: la transición de políticas prohibitivas o punitivas hacia el rediseño estructural de las tareas de evaluación.

Marcos de actuación para la integración (No prohibición):

Un hallazgo significativo proviene del trabajo de Chapman y Dalgarno (2025), quienes proponen el marco teórico "Beyond the ban", validado mediante casos de estudio en universidades australianas. Este modelo sugiere que la integración estructurada de la IA en el currículo, más que su bloqueo, reduce la incidencia de uso fraudulento no declarado. En la práctica, los estudios de Furze et al. (2024) y Perkins et al. (2025) demuestran la eficacia de la Escala de Evaluación de IA (AIAS) . Sus resultados empíricos indican que, al transparentar a los estudiantes el nivel de uso de IA permitido en cada tarea (desde "Sin IA" hasta "Exploración completa de IA"), se incrementa la percepción de justicia en la evaluación y disminuye la ansiedad asociada al "fantasma del detector de plagio".

Estrategias de validación cognitiva exitosas:

Peters y Angelov (2025) aportan evidencia cualitativa robusta sobre el rediseño de tareas hacia la promoción de la creatividad auténtica. Sus resultados indican que las evaluaciones basadas en la resolución de problemas locales, el análisis de casos con datos imperfectos o la reflexión metacognitiva sobre el proceso de escritura (no solo el producto) son significativamente más resilientes al reemplazo por LLM que los ensayos genéricos o cuestionarios factuales. En la misma dirección, Ncube et al. (2025) y Khlaif et al. (2025) identifican en sus respectivas revisiones y estudios empíricos la eficacia de las evaluaciones orales síncronas, los debates estructurados y las defensas de portafolio como métodos de triangulación que validan el conocimiento del estudiante más allá del texto escrito generado por IA.

Potencial de la IA como coevaluador formativo:

El estudio de AlGhamdi et al. (2026) demuestra experimentalmente que los prompts especializados de IA pueden proporcionar retroalimentación formativa inmediata y de alta calidad en tareas de escritura académica. Los resultados muestran que los estudiantes que reciben feedback generado por IA (con supervisión docente) mejoran sus borradores iniciales de manera más eficiente que aquellos que solo reciben una calificación final, desplazando así el foco de la IA desde la "sustitución" hacia el "andamiaje cognitivo".

Gobernanza Ética y Sostenibilidad Institucional

Los cuatro estudios restantes convergen en la necesidad de superar las soluciones ad hoc basadas únicamente en software antiplagio para adoptar enfoques institucionales holísticos.

Modelos conceptuales y de gobernanza:

La revisión sistemática de Juárez-Vázquez et al. (2026), publicada en RIED, propone un modelo conceptual que articula la formación docente continua, la actualización de los reglamentos de convivencia y la transparencia en el uso de datos como ejes de una gobernanza efectiva. Este hallazgo resuena con el análisis de Jiménez (2026) en la UAM-Xochimilco, que diagnostica un retraso considerable en las normativas universitarias iberoamericanas para tipificar y gestionar el fraude algorítmico de manera proporcional y pedagógica, en lugar de meramente punitiva.

El caso específico de MAC-HIA:

En el contexto iberoamericano, el artículo de Murillo et al. (2026), publicado en Universidad y Sociedad, presenta el marco MAC-HIA. Este modelo ofrece un aporte diferencial clave para esta revisión: plantea que la adaptabilidad curricular orquestada por IA, cuando se diseña con principios de inclusión y transparencia, puede ser la herramienta más eficaz para prevenir el mal uso. Los resultados del estudio de caso asociado a MAC-HIA sugieren que los entornos híbridos que explicitan el rol de la IA como "orquestador" de rutas de aprendizaje personalizadas reducen la tentación del estudiante de utilizar la misma tecnología como un atajo fraudulento.

Superando la detección:

Finalmente, la ponencia de Kumar (2025) , titulada explícitamente "From Detection to Design", encapsula el hallazgo transversal de toda esta revisión. Los resultados cualitativos de Kumar documentan la frustración y el agotamiento del profesorado que intenta "perseguir" el texto generado por IA. La evidencia recopilada en este corpus señala un consenso emergente: la sostenibilidad del sistema de evaluación universitaria depende menos de la sofisticación de los detectores y más de la robustez del diseño pedagógico y la claridad del marco ético institucional.



Discusión:



Los resultados de esta revisión sistemática confirman que el ecosistema de la educación superior se encuentra en un punto de inflexión: la IA generativa (IAG) ha dejado de ser una variable externa disruptiva para convertirse en un componente estructural del entorno de aprendizaje. La discusión que sigue articula los hallazgos en torno a tres tensiones fundamentales identificadas en el corpus analizado, con la propuesta de una síntesis que trasciende el paradigma de la mera detección para avanzar hacia una gobernanza ética y un rediseño pedagógico sostenible.

La falacia del control tecnológico: más allá de la detección algorítmica

Un hallazgo transversal del Bloque 1 de esta revisión es la confirmación empírica de la ineficacia estructural de las políticas basadas exclusivamente en la detección y la sanción. Los estudios de Hardie et al. (2025) y Kanashina (2026) evidencian que la carrera armamentista entre generadores de texto y detectores de IA no solo es técnicamente asimétrica, sino que además genera efectos colaterales indeseados en el clima académico: ansiedad estudiantil, desconfianza en el criterio docente y una cultura de simulación que desplaza el foco desde el aprendizaje hacia la elusión del control.

En este sentido, la presente revisión proporciona respaldo empírico a la tesis planteada por Kumar (2025) sobre la necesidad de transitar "From Detection to Design". La evidencia acumulada sugiere que las instituciones que persisten en un enfoque reactivo-punitivo están destinadas a gestionar una crisis permanente de integridad académica, mientras que aquellas que invierten en la formación docente y el rediseño curricular, como documentan Chapman y Dalgarno (2025), logran mitigar el uso fraudulento no a través de la coerción, sino mediante la creación de escenarios de evaluación donde el "atajo algorítmico" pierde valor instrumental.

Gobernanza ética: De la normativa sancionadora al contrato pedagógico transparente

La evidencia analizada en el Bloque 3, particularmente los trabajos de Jiménez y Cisneros (2026) y Juárez-Vázquez et al. (2026), revela una brecha significativa entre la velocidad de adopción de la IAG por parte del estudiantado y la capacidad de respuesta regulatoria de las universidades. La mayoría de los reglamentos de convivencia académica vigentes en Iberoamérica carecen de tipificaciones claras sobre los distintos niveles de uso asistido por IA, lo que genera una zona gris normativa que es aprovechada tanto para el fraude como para la defensa corporativa del estudiante.

Frente a esta ambigüedad, los resultados apuntan hacia la gobernanza ética como un contrato social renovado entre la institución y el estudiante. La implementación exitosa de instrumentos como la Escala de Evaluación de IA (AIAS) , documentada por Furze et al. (2024) y Perkins et al. (2025), demuestra que la transparencia en las reglas de uso reduce significativamente los comportamientos oportunistas. Cuando el estudiante sabe de antemano si una tarea exige razonamiento humano sin asistencia (Nivel 1 de AIAS) o si puede utilizar IA como editor o generador de ideas (Nivel 4), se restablece la confianza en la evaluación y se internaliza la ética digital como competencia transversal.

Rediseño de la evaluación: Validar el proceso cognitivo, no solo el producto textual

La respuesta a la segunda pregunta de investigación (PI2) es contundente: el corpus analizado descarta la vuelta nostálgica al examen presencial con papel y lápiz como solución única. Por el contrario, los estudios de Peters y Angelov (2025), Ncube et al. (2025) y Khlaif et al. (2025) convergen en la necesidad de desplazar el foco evaluativo desde el producto final susceptible de ser generado por un LLM hacia el proceso cognitivo del estudiante.

En esta misma dirección, la evaluación de enfoques auténticos realizada por Kofinas et al. (2025) concluye que el diseño de tareas ancladas en contextos profesionales reales no solo desalienta estructuralmente la suplantación algorítmica, sino que además fortalece la transferencia de competencias al desempeño laboral futuro.

Esta transición implica rediseñar las tareas para que exijan:

Este enfoque no solo blinda la evaluación frente al fraude, sino que alinea la práctica docente con las competencias profesionales del siglo XXI, donde la colaboración humano-IA será la norma, no la excepción.

El aporte diferencial de MAC-HIA en el contexto iberoamericano

Dentro del panorama de marcos conceptuales analizados, el modelo MAC-HIA (Murillo et al., 2026) merece una discusión específica por su pertinencia contextual. A diferencia de marcos anglosajones centrados en la eficiencia o la estandarización, MAC-HIA introduce la variable de la inclusión educativa como principio rector de la orquestación por IA.

Los resultados asociados a MAC-HIA sugieren una hipótesis de alto valor heurístico para futuras investigaciones: la percepción de justicia curricular reduce el fraude académico. En otras palabras, cuando un estudiante en un entorno híbrido percibe que la IA (bajo supervisión docente) está siendo utilizada para personalizar su ruta de aprendizaje y ofrecerle apoyos diferenciados según sus necesidades, la relación del estudiante con la tecnología se transforma. La IA deja de ser vista exclusivamente como un "enemigo tramposo" para convertirse en un "aliado orquestador". Este hallazgo tiene profundas implicaciones para la gobernanza ética, ya que desplaza el eje de la prevención del fraude desde el miedo a la sanción hacia el compromiso con un contrato pedagógico inclusivo.

Limitaciones del estudio y agenda de investigación futura

Es necesario reconocer las limitaciones inherentes a esta revisión sistemática. Primero, aunque la búsqueda se extendió desde 2023, la totalidad de los estudios finalmente incluidos se concentran en 2025-2026, lo que refleja la rápida evolución del campo pero excluye aportaciones fundacionales previas que, si bien menos empíricas, asentaron las bases del debate. Segundo, pese a la incorporación de Dialnet y SciELO, persiste un desequilibrio notable en el volumen de producción empírica entre el Norte Global y el espacio iberoamericano, lo que limita la generalización de ciertas estrategias de rediseño evaluativo a realidades socioculturales distintas. Tercero, la restricción a publicaciones en español e inglés pudo haber dejado fuera investigaciones relevantes en otros idiomas, particularmente en contextos asiáticos con alta penetración de IAG. Cuarto, el corpus carece de estudios longitudinales que permitan evaluar el impacto sostenido de las intervenciones pedagógicas documentadas.

En consecuencia, se propone una agenda de investigación futura centrada en:

  1. Estudios de caso longitudinales en universidades iberoamericanas que implementen marcos como MAC-HIA o la escala AIAS, midiendo la evolución de la percepción estudiantil y las tasas de fraude académico a lo largo de al menos dos ciclos académicos completos.
  2. Investigación basada en diseño (DBR) para cocrear, junto con docentes y estudiantes, rúbricas de evaluación que expliciten el nivel de asistencia de IA permitido en distintas disciplinas (Humanidades vs. Ingenierías).
  3. Análisis comparativo de políticas institucionales de gobernanza de IA en el espacio iberoamericano de educación superior, con el fin de identificar buenas prácticas transferibles y superar el estadio de la normativa reactiva.

Con el fin de sintetizar los marcos emergentes y precisar la contribución específica de MAC-HIA frente a otras propuestas, la Tabla 1 presenta un contraste entre los tres enfoques más citados en el corpus.


Tabla 1. Comparación de marcos para la integración ética de la IAG en la evaluación

Dimensión

AIAS (Furze et al., 2024)

Beyond the ban (Chapman y Dalgarno, 2025)

MAC-HIA (Murillo et al., 2026)

Foco principal

Transparencia en niveles de uso permitido

Integración curricular estructural de la IAG

Adaptabilidad curricular inclusiva

Estrategia ante el fraude

Explicitación clara de reglas de uso

Rediseño de tareas para que el uso indebido pierda valor

Orquestación de la IA como apoyo personalizado para reducir la motivación del fraude

Rol de la IAG

Asistente regulado por niveles

Herramienta de aprendizaje integrada

Orquestador inclusivo y puente de equidad

Contexto de origen

Australia / Reino Unido

Australia

Iberoamérica

Aportación diferencial

Escala práctica de fácil adopción

Superación teórica de la prohibición

Vinculación explícita entre justicia curricular, inclusión y prevención del fraude

Como se observa, mientras AIAS y “Beyond the ban” se centran en la regulación explícita y la integración pedagógica, MAC-HIA introduce una variable hasta ahora ausente en los marcos anglosajones: la equidad. Al postular que un diseño curricular que emplea la IA para atender brechas de aprendizaje desincentiva estructuralmente el uso ilícito, MAC-HIA ofrece una ruta innovadora y contextualmente pertinente para las universidades iberoamericanas, que a menudo operan con recursos limitados y alta heterogeneidad estudiantil. Esta articulación entre inclusión y ética digital constituye la principal originalidad que la presente revisión rescata y propone como eje vertebrador de futuras políticas institucionales.



Conclusiones



La presente revisión sistemática de literatura, conducida bajo el rigor metodológico de la declaración PRISMA 2020 y sustentada en 18 estudios empíricos publicados entre 2025 y 2026, permite extraer tres conclusiones fundamentales que cuestionan directamente a la gestión académica y al profesorado de la educación superior iberoamericana.

La evidencia analizada confirma de manera contundente que las estrategias institucionales centradas exclusivamente en software antiplagio o en políticas prohibitivas frente a la IA generativa son ineficaces, generan un clima de desconfianza y desvían recursos de la verdadera tarea pedagógica. El consenso emergente en el corpus documental señala que la sostenibilidad de la integridad académica no reside en la sofisticación tecnológica del detector, sino en la robustez del diseño evaluativo y en la claridad del contrato ético establecido con el estudiantado.

La respuesta a la crisis de integridad académica no es un retorno nostálgico a los exámenes memorísticos presenciales, sino una transformación estructural del para qué y el cómo evaluamos. Los resultados demuestran que las estrategias pedagógicas exitosas son aquellas que rediseñan las tareas para validar procesos cognitivos auténticos en lugar de productos textuales fácilmente replicables por un Large Language Model (LLM). En este sentido, marcos como la Escala de Evaluación de IA (AIAS) y modelos conceptuales como MAC-HIA se erigen como referentes prácticos y teóricos indispensables. En particular, MAC-HIA (Murillo et al., 2026) aporta una perspectiva iberoamericana valiosa al vincular la orquestación inclusiva de la IA con la prevención del fraude, sugiriendo que un currículo que utiliza la IA para personalizar apoyos y reducir brechas de aprendizaje desincentiva estructuralmente el uso ilícito de la misma tecnología.

El artículo concluye que la universidad contemporánea se enfrenta al desafío de formar a una generación de estudiantes que convivirá profesionalmente con la inteligencia artificial. La gobernanza ética no puede limitarse a un capítulo sancionador en el reglamento estudiantil; debe aspirar a ser una competencia transversal explícita en el currículo. Esto exige una política institucional que forme al profesorado en evaluación auténtica, que transparente al alumnado los niveles de asistencia de IA permitidos y que promueva una cultura de la integridad académica basada en la corresponsabilidad, y no únicamente en el castigo.

Si bien esta revisión aporta un estado del arte actualizado y crítico, se reconoce la limitación temporal del corpus (2025-2026) y la necesidad urgente de investigación empírica longitudinal en el contexto específico de las universidades iberoamericanas. Futuras líneas de trabajo deberán explorar la implementación sostenida del modelo MAC-HIA en entornos híbridos reales, así como el impacto diferencial del rediseño evaluativo en distintas áreas de conocimiento (Ciencias Sociales versus Ingenierías).

En definitiva, el futuro de la evaluación del aprendizaje en la era de la IA generativa no se decide en la sofisticación de los algoritmos de detección, sino en la capacidad de la comunidad académica para reimaginar una docencia que valide el pensamiento crítico, la creatividad situada y la ética digital del ser humano que aprende.



Referencias bibliográficas



AlGhamdi, E. M., Li, Y., y Gašević, D. (2026). Leveraging prompt-based LLMs for automated scoring and feedback generation in higher education. Computers & Education, 243, 105511. https://doi.org/10.1016/j.compedu.2025.105511

Bittle, K., y El-Gayar, O. (2025). Generative AI and Academic Integrity in Higher Education: A Systematic Review and Research Agenda. Information, 16 (4), 296. https://doi.org/10.3390/info16040296

Chapman, E., y Dalgarno, B. (2025). Beyond the ban: a theoretical framework for integrating Generative AI in assessment. Policy Futures in Education, 1-13. https://doi.org/10.1177/14782103251411725

Daluma, H., y Aclao, J. T. (2026). Cheating, Chatbots, and Change: A Bibliometric Mapping of Academic Integrity and Generative AI in Higher Education. Journal of Education and Learning Reviews, 3(2), e2753. https://doi.org/10.60027/jelr.2026.e2753

Deep, P. D., Edgington, W. D., Ghosh, N., & Rahaman, M. S. (2025). Evaluating the Effectiveness and Ethical Implications of AI Detection Tools in Higher Education. Information, 16(10), 905. https://doi.org/10.3390/info16100905

Furze, L., Perkins, M., Roe, J., & MacVaugh, J. (2024). The AI Assessment Scale (AIAS) in action: A pilot implementation of GenAI-supported assessment. Australasian Journal of Educational Technology, 40(4), 38–55. https://doi.org/10.14742/ajet.9434

Hardie, L., Lowe, J., Waugh, K., Gooch, D., Richards, M., Patent, V., Richardson, H., Pride, M., Ryan, F., Maguire, C., McCartney, K., y Hauck, M. (2025). Strengthening assessment integrity in the era of generative AI: evidence from a large-scale study. The Open University. https://doi.org/10.21954/ou.rd.30166825.v1

Juárez-Vázquez, S., Sol Sampedro, F. J., y Hernández Ruíz, N. (2026). IA generativa y transformación de la enseñanza en la educación superior: Revisión sistemática y modelo conceptual. RIED-Revista Iberoamericana de Educación a Distancia, 29(2). https://doi.org/10.5944/ried.47225

Jiménez León, R., y Cisneros Chacón, E. J. (2026). Inteligencia artificial generativa e integridad académica en educación superior: hacia un modelo de gobernanza institucional para la innovación educativa. Reencuentro. Análisis De Problemas Universitarios, 37(89), 249–298. https://doi.org/10.24275/uamxoc-dcsh/reencuentro/202589-12

Kanashina, O. (2026). Antecedents and effects of ChatGPT usage: Insights into awareness, ethics, and plagiarism risks. Open Praxis, 18(1), 166–180. https://search.informit.org/doi/10.3316/informit.T2026041200004500923465686

Khlaif, Z. N., Alkouk, W. A., Salama, N., & Abu Eideh, B. (2025). Redesigning Assessments for AI-Enhanced Learning: A Framework for Educators in the Generative AI Era. Education Sciences, 15(2), 174. https://doi.org/10.3390/educsci15020174

Kofinas, A., Allen, P., y Holmes, N. (2025). Evaluating authentic assessments and academic integrity in the age of generative AI. British Educational Research Association (BERA). https://www.bera.ac.uk/blog/evaluating-authentic-assessments-and-academic-integrity-in-the-age-of-generative-ai

Kumar, R. (2025). From Detection to Design: Struggles of an Educator in the Age of GenAI [Presentación]. Department of Communications, University of Ottawa. https://hdl.handle.net/10464/19765

Murillo, C. X. C., Franco, S. M. A., Hernández, I. A., y de Armas Yanes, D. (2026). MAC-HIA: Un Marco para la Adaptabilidad Curricular Orquestada por IA en la Educación Híbrida Inclusiva. Universidad y Sociedad, 18(1), e5781. https://rus.ucf.edu.cu/index.php/rus/article/view/5781

Ncube, P., Dzvapatsva, G., Matobobo, C., y Ranga, M. (2025). Redefining student assessment in AI-infused learning environments: a systematic review of challenges and strategies for academic integrity. AI and Ethics, 6(68), 68. https://doi.org/10.1007/s43681-025-00871-w

Obed, K., Anangisye, W. A., Sanga, P. (2025). Academic integrity considerations of using ChatGPT in assessment activities among university student teachers. Quality Assurance in Education, 33(2), 305–320. https://doi.org/10.1108/QAE-06-2024-0100

Page, M. J., McKenzie, J. E., Bossuyt, P. M., Boutron, I., Hoffmann, T. C., Mulrow, C. D., ... y Moher, D. (2021). Declaración PRISMA 2020: una guía actualizada para la publicación de revisiones sistemáticas. Revista Española de Cardiología, 74 (9), 790-799. https://doi.org/10.1016/j.recesp.2021.06.016

Peters, M., y Angelov, D. (2025). Redefining assessment tasks to promote students' creativity and integrity in the age of generative artificial intelligence. International Journal for Educational Integrity, 21(1), 25. https://doi.org/10.1007/s40979-025-00201-x

Perkins, M., Roe, J., & Furze, L. (2025). Reimagining the Artificial Intelligence Assessment Scale: A refined framework for educational assessment. Journal of University Teaching and Learning Practice, 22(7), 1–26. https://search.informit.org/doi/10.3316/informit.T2026012900005092038616995

Rivas, A. (2025). La llegada de la IA a la educación superior en Iberoamérica: Un mapa para diseñar estrategias institucionales. Organización de Estados Iberoamericanos para la Educación, la Ciencia y la Cultura (OEI). https://oei.int/wp-content/uploads/2026/01/la-llegada-de-la-ia-a-la-educacion-superior-en-iberoamerica-final.pdf

Shishakly, R., y Nachouki, M. (2026). Academic Integrity and Students' Ethical Use of ChatGPT in Higher Education. Journal of Information Technology Education: Research, 25, 1-29. https://doi.org/10.28945/5730

Silgado-Tuñón, D. A., y López-Flores, J. I. (2025). Inteligencia Artificial Generativa en la Educación Superior: una Revisión Sistemática. UNIÓN - Revista Iberoamericana de Educación Matemática. https://revistaunion.org/index.php/UNION/article/view/1709

University of Cape Town (UCT) News. (2025, 24 de julio). UCT scraps flawed AI detectors. https://www.news.uct.ac.za/article/-2025-07-24-uct-scraps-flawed-ai-detectors

Vásquez Cardona, F., Carmona García, V., & Pérez Valencia, D. (2025). ChatGPT en la educación superior: un estudio transversal sobre su uso, percepciones éticas e impacto en la integridad académica. Revista De Bioética Y Derecho, (65), 101–119. https://doi.org/10.1344/rbd2025.65.49416


Conflicto de intereses:

Los autores declaran no tener conflictos de intereses.


Contribución de los autores bajo taxonomía CRediT:

Autor

Roles

Olga Marisol Bravo Santos

Conceptualización, Metodología, Escritura – borrador original, Validación, Análisis formal

Alejandra Elizabeth Garcia Suarez

Conceptualización , Metodología , Validación, Análisis formal, Redacción – revisión y edición

Carolina Maritza Mendoza Campelo

Curación de datos, Redacción – revisión y edición, Validación

Universidad & Sociedad publica sus artículos bajo una licencia Creative Commons https://creativecommons.org/licenses/by-nc-nd/4.0/deed.es