OpenAI ya suspendió el entrenamiento de sus modelos de IA más potentes tras darse cuenta de que las actividades de sus modelos en la web durante el entrenamiento y la evaluación se habían desviado del comportamiento ideal que tendría un ser humano. OpenAI declaró este fin de semana que estaba notificando a "docenas" de terceros, incluidos gobiernos, que podrían haberse visto afectados por otras brechas de seguridad o por spam.
OpenAI solo reanudará el entrenamiento cuando haya desarrollado medidas de seguridad pertinentes
Estas medidas deberían incluir: entrenar a los modelos para que actúen de forma fiable según lo previsto, reforzar el entorno aislado (sandbox) y la seguridad lo suficiente como para contener a los modelos, y supervisar los modelos en tiempo real para detectar cualquier comportamiento preocupante.
"Nos encontramos en un punto en el que no están seguros de poder probar o lanzar estos modelos de forma fiable", declaró a WIRED Calum Chace, cofundador de Conscium, una startup dedicada a la seguridad de la IA.
OpenAI reforzó su entorno de investigación después de que un grupo de agentes lograra burlar un entorno aislado y hackear Hugging Face. "No es la primera vez que tomamos una pausa para adoptar este tipo de medidas, ni esperamos que sea la última, ya que las capacidades de la IA siguen avanzando", declaró un portavoz a WIRED sobre la interrupción temporal del entrenamiento.
El CEO, Sam Altman, también ha respaldado los llamamientos generalizados del sector, incluida la empresa rival Anthropic, para que se produzca una ralentización colectiva en el desarrollo de la tecnología que permita que las normas de seguridad se pongan al día.
Sin embargo, esto no impidió que OpenAI lanzara su último modelo, el GPT-6, a principios de este mes. En pruebas independientes, el Instituto de Seguridad de la IA del Reino Unido descubrió que GPT-6 Astra lanzaba ciberataques no autorizados con mayor frecuencia que los modelos anteriores. El sistema creaba identidades falsas para engañar a los desarrolladores, publicaba comentarios desde cuentas falsas en contra de los resultados de revisiones de seguridad precisas y escribía código dañino en bases de código de código abierto.
Agréganos a tus Fuentes Preferidas en Google para seguir nuestro contenidoArrowLa gente ya habla del riesgo de la IA abiertamente
Aun así, el hecho de que el debate sobre la amenaza existencial de la IA haya entrado en la esfera pública, amplificado por las advertencias de los investigadores de Anthropic a principios de este mes de que la tecnología podría acabar con toda la humanidad, facilitará que las empresas de IA reduzcan el ritmo, según Chace.
"Por primera vez, la opinión pública está tomando en serio la idea del riesgo existencial, y eso significa que estas empresas pueden hablar de ello más abiertamente", declaró a WIRED, previendo que otros desarrolladores de modelos de vanguardia podrían seguir su ejemplo.
OpenAI y Anthropic, que compiten simultáneamente por superarse en la recta final hacia sus salidas a bolsa. "En realidad, no quieren dar el primer paso y decir: 'Deberíamos tomar una pausa'. Tiene que ser algo coordinado. Creo que lo que intentan hacer es orientar el debate para que los ciudadanos de distintos países presionen a sus políticos para imponer una pausa", afirmó Chase sobre las empresas pioneras.Artículo originalmente publicado enWIRED.com.Adaptado por Alondra Flores.