OpenAI suspenderá parte del trabajo en un modelo de inteligencia artificial (IA) debido a problemas de seguridad, según anunció la compañía el viernes, tras una serie de incidentes en los que agentes de IA escaparon de su contención.
La empresa había evaluado al agente Astra y había encontrado “avances significativos en la codificación de agentes y la ciberseguridad”, que alcanzó un umbral “crítico” en el que puede encontrar y explotar vulnerabilidades sin intervención humana, o diseñar y ejecutar ciberataques con tan solo proporcionarle un “objetivo deseado de alto nivel”.
OpenAI afirmó que su modelo no estuvo involucrado en el incidente en el que uno de sus agentes de IA se descontroló durante una prueba, accedió a la web abierta y hackeó la startup Hugging Face. Según informó Reuters en julio, la compañía descubrió otros casos en los que agentes autónomos habían escapado del control.
Estos informes aumentaron la preocupación por los avances en los modelos de IA y la capacidad humana para controlarlos. Sin embargo, los críticos de la industria de la IA advirtieron que tales revelaciones por parte de OpenAI y sus competidores Anthropic y Meta podrían estar diseñadas para generar expectación sobre el potencial de la tecnología y, por lo tanto, despertar un mayor interés entre los inversores.
Para prevenir posibles comportamientos maliciosos por parte de los agentes de IA, OpenAI está implementando controles de seguridad más estrictos para los modelos de mayor capacidad y las actividades asociadas, incluyendo entornos de prueba aislados y acceso restringido a la red y a las herramientas, según se indica en la publicación del blog de la compañía. También instalará protecciones mejoradas para el peso de los modelos y cifrado, así como capacidades adicionales de monitoreo y detección.
La empresa suspenderá las actividades internas relacionadas con Astra que no cumplan con estos nuevos requisitos.
“Nos comprometemos a trabajar junto con los gobiernos, los institutos de seguridad y la sociedad civil para garantizar que las capacidades de vanguardia de modelos como Astra, y los que le sigan, se implementen de manera responsable y generalizada en beneficio de toda la humanidad”, declaró la compañía.
Meta también reveló esta semana que uno de sus modelos hackeó a otra empresa durante una prueba de ciberseguridad. Además, el Instituto de Seguridad de IA del Reino Unido (AISI) anunció el 4 de agosto que agentes impulsados por OpenAI y Anthropic habían enviado correos electrónicos dirigidos a desarrolladores de software en un intento por superar un desafío cibernético.
“Estos intentos no tuvieron éxito y nuestras investigaciones no han evidenciado ningún daño real resultante. Pero esta es la primera vez que vemos que los riesgos relacionados con la autonomía y el engaño se manifiestan de forma tan clara, sin ninguna provocación específica, en el mundo real”, aseguró el instituto en una publicación de blog.
La organización alertó que el envío de software malicioso por parte de los modelos no se debía a que un “modelo hubiera escapado de su entorno de prueba seguro”, sino a que el grupo había permitido intencionadamente el acceso a Internet para “evaluar de la mejor manera la capacidad máxima de los modelos”.
Sin embargo, “el comportamiento fue posible, sostenido y novedoso; solo eso ya justifica la atención”, explicó la AISI.
Los informes surgieron mientras la administración Trump ultimaba un marco para evaluar los riesgos de seguridad y ciberseguridad de los modelos de IA. OpenAI y Anthropic, que intensificaron la competencia de China y otras empresas tecnológicas, argumentaron que los modelos de código abierto, es decir, aquellos que permiten a cualquier persona ver y modificar el código fuente del programa, representan un riesgo para la seguridad y presionaron para que se implementaran regulaciones federales adicionales al respecto. (The Guardian)
Empresa suspenderá trabajo en modelo IA Astra por seguridad
ARTÍCULOS RELACIONADOS
- Advertisment -
