Los desarrolladores de los modelos de inteligencia artificial más avanzados deberían someter sus sistemas a auditorías externas independientes capaces de revisar sus pruebas de seguridad y las condiciones bajo las cuales serán desplegados. Dejar esa evaluación exclusivamente en manos de las propias compañías concentra en ellas la decisión sobre hasta dónde puede avanzar una tecnología que ya ejecuta tareas durante periodos cada vez más largos con menor intervención humana, plantearon especialistas de la Universidad Iberoamericana.
Andrés Guillermo Molano Jiménez, director del Departamento de Estudios en Ingeniería para la Innovación de la Ibero, sostuvo que la supervisión externa debería convertirse en una regla para los llamados modelos de frontera, término utilizado para identificar a los sistemas más avanzados disponibles en un momento determinado.
Su planteamiento parte de que las empresas desarrolladoras realizan evaluaciones internas y colocan barreras de seguridad antes de liberar sus modelos, mientras esas pruebas permanecen bajo control de las mismas organizaciones que deciden cuándo lanzar una nueva versión y qué capacidades habilitar.
“Las compañías tratan de instalar sistemas de seguridad, pero logran evadir estos sistemas. Entonces, creo que no está bien que solamente le demos completa libertad a las compañías de modelos de frontera para decidir hasta cuándo parar y a qué velocidad ir. Debe haber auditores externos que estén revisando eso”, dijo Molano durante la mesa de análisis.
La propuesta aparece mientras los laboratorios que desarrollan estos modelos reconocen que sus sistemas pueden realizar cadenas de acciones cada vez más extensas. Molano explicó que los agentes actuales pueden recibir un objetivo y continuar trabajando sobre él con herramientas externas durante periodos prolongados. Esa capacidad corresponde a una autonomía operativa que permite al sistema decidir parte del camino utilizado para alcanzar una meta previamente establecida por una persona.
“Actualmente pueden recibir un objetivo, plantear una secuencia de acciones, utilizar herramientas, escribir código, consultar información, corregir errores y continuar trabajando durante periodos cada vez más largos con menor intervención de los humanos”, explicó Molano.
El especialista advirtió que una máquina puede comenzar a decidir cómo alcanzar un objetivo sin adquirir con ello la facultad de determinar qué objetivos deberían perseguirse o qué consecuencias resultan aceptables.
El aumento de esa autonomía modifica también el objeto de una auditoría. Revisar un chatbot que responde una consulta exige pruebas distintas de las necesarias para evaluar un agente autorizado a utilizar software o interactuar con sistemas externos. OpenAI publicó en mayo una guía para evaluaciones de terceros donde reconoce que el desempeño de los modelos de frontera depende también del entorno donde ejecutan una tarea y de las herramientas disponibles para realizarla.
Google DeepMind mantiene una lógica semejante dentro de su Frontier Safety Framework, actualizado en abril. El esquema establece evaluaciones durante el ciclo de vida de los modelos más avanzados y contempla la participación de terceros cuando resulte necesaria para determinar sus capacidades o revisar las medidas utilizadas frente a riesgos severos.
Alexandro López González, coordinador de la Licenciatura en Inteligencia Artificial de la Ibero, ubicó una parte del problema en las características probabilísticas de estos sistemas. La propia universidad lo identifica como coordinador del programa, que comenzó a impartirse en agosto de 2026.
Un modelo genera respuestas mediante relaciones estadísticas aprendidas durante su entrenamiento y puede producir una salida equivocada dentro de su funcionamiento normal. Para López González, esa condición vuelve especialmente delicado permitir que una inteligencia artificial tenga control autónomo sobre procesos donde una equivocación puede escalar rápidamente.
Luis Medina Gual, director de Innovación Educativa de la Ibero, advirtió que los modelos actuales tienen una complejidad que impide explicarlos como una relación estadística elemental.
“Abrir esta caja negra no significa que el modelo se pueda explicar, o sea, ni sus propios creadores pueden hacerlo del todo. Son modelos supercomplejos”, dijo Medina Gual. Para el académico, la transparencia tendría que concentrarse también en información comprobable sobre la manera en que fue construido y evaluado el sistema.
Examinar un modelo puede requerir información sobre sus pruebas previas al lanzamiento y acceso suficiente para reproducir algunos resultados. También puede implicar revisar la metodología cuando ejecutar nuevamente un experimento exige una cantidad de capacidad de cómputo fuera del alcance de una universidad o laboratorio independiente.
“Transparencia se refiere más bien a auditar estos procesos y también es dar acceso privilegiado para auditores, para investigadores y periodistas para poder entender esto”, dijo Medina Gual. El académico agregó que las empresas deberían habilitar protecciones jurídicas para las personas que realizan ese escrutinio.
Contratar a un tercero no elimina automáticamente los conflictos de interés cuando su financiamiento depende del mismo desarrollador al que debe examinar. Los participantes de la mesa plantearon que la comunidad científica podría cumplir parte de esa función siempre que tenga capacidad de acceder a los sistemas y conservar independencia respecto de las empresas.
López González consideró que la publicación y revisión abierta de modelos puede contribuir a ese proceso porque permite que investigadores externos busquen vulnerabilidades y estudien sus capacidades. También advirtió que concentrar la revisión en una sola organización puede reproducir dependencias económicas respecto de las compañías evaluadas.
Anthropic reconoce que su política permite que distintas secciones de un mismo informe confidencial sean revisadas por personas diferentes siempre que todo el documento haya sido examinado al menos una vez. La empresa sostiene además que conforme aumenten las capacidades de los modelos serán necesarias pruebas externas más rigurosas y una supervisión gubernamental más profunda.
La supervisión también depende de mantener identificada la responsabilidad de las organizaciones que desarrollan y utilizan estos sistemas. Verónica Díaz de León Bermúdez, académica adscrita al Departamento de Filosofía de la Ibero, planteó durante la mesa que la creciente automatización no convierte a una inteligencia artificial en un actor capaz de asumir las consecuencias de sus decisiones.
Para Díaz de León Bermúdez, el crecimiento de la autonomía operativa obliga a precisar qué función conserva la empresa que desarrolla la tecnología y qué responsabilidad corresponde a las instituciones públicas encargadas de establecer límites para su utilización.
“Se está diluyendo precisamente esta necesaria distinción de funciones de qué le toca a una empresa tecnológica desarrollar”, dijo la especialista. Su planteamiento fue que las compañías producen estas tecnologías dentro de un marco donde los gobiernos conservan la responsabilidad de establecer las condiciones bajo las cuales pueden utilizarse.
La auditoría externa tampoco implica que un tercero pueda certificar de una vez y para siempre que un modelo es seguro. Los modelos cambian y las condiciones donde se utilizan también pueden modificar su comportamiento. Una evaluación realizada antes de un lanzamiento ofrece información sobre determinadas pruebas y configuraciones. La conexión posterior con nuevas herramientas puede abrir capacidades que anteriormente estaban ausentes.
Para Molano, esa combinación explica por qué el desarrollador debe dejar de ser la única instancia que determina hasta dónde puede llegar su tecnología. Cuando un modelo recibe mayor autonomía, la evaluación debe acompañar ese cambio y comprobar qué ocurre fuera de los escenarios diseñados por la propia compañía.
“Cuando combinamos modelos poderosos con objetivos, herramientas y accesos a la información, permisos y mucho tiempo para actuar, pueden aparecer comportamientos que los ingenieros o sus desarrolladores no anticiparon”, dijo Molano. Las pruebas que producen esos resultados se realizan precisamente para localizar fallas antes de que aparezcan en sistemas utilizados fuera del laboratorio.
La discusión sobre auditorías externas de modelos de frontera se concentra en quién puede comprobar las afirmaciones de seguridad de quienes construyen los modelos y con qué información puede hacerlo. Conforme una inteligencia artificial recibe más permisos para ejecutar acciones, la supervisión deja de depender únicamente de revisar lo que responde. También requiere observar qué puede hacer y qué ocurre cuando encuentra un camino que sus desarrolladores no habían previsto.
Nota aclaratoria: Las noticias no reflejan necesariamente la opinión de la Firma García Terán y Torres Asociados SC y/o de alguno de sus integrantes. La responsabilidad corresponde, a la fuente y/o el autor del artículo o comentario en particular.
Fuente de Información: El ECONOMISTA