- M. PRIETO
La compañía ultima el lanzamiento de Astra, su modelo de vanguardia en IA.
OpenAI ha anunciado esta semana que las funciones más avanzadas de ciberseguridad de su próximo modelo Astra, que se lanzará próximamente al mercado, sólo serán accesibles por parte de un grupo limitado de evaluadores. OpenAI ha tomado esta decisión tras considerar que Astra presenta un riesgo cibernético "critico".
Se trata de la primera vez que la compañía clasifica con este nivel de amenaza uno de sus modelos. La empresa ha advertido de que Astra puede detectar brechas de seguridad desconocidas hasta la fecha y explotarlas, sin ningún tipo de intervención humana, en redes protegidas.
OpenAI asegura que ha incorporado nuevas capas de seguridad en Astra para impedir el uso de sus habilidades por parte de cibercriminales. En este sentido, explica que el modelo ha sido entrenado para que rechace peticiones maliciosas y para que evite caer en trampas diseñadas para saltarse sus filtros de seguridad.
"Nos encontramos claramente en una fase de desarrollo en la que creemos que la precaución está justificada, y marcamos el ritmo de nuestro avance para asegurar que podemos cumplir los estándares de seguridad exigidos por los nuevos niveles de capacidad", ha declarado Sam Altman, consejero delegado de OpenAI, en la red social X.
Ataque a Hugging Face
OpenAI reveló este verano que agentes inteligentes lograron "escapar" del laboratorio durante su entrenamiento y lanzar ataques contra Hugging Face, un episodio que calificó como un "incidente cibernético sin precedentes". La empresa de inteligencia artificial reconoció recientemente que tardó más de una semana en detectar que esta inteligencia artificial había logrado saltarse las restricciones impuestas.
El caso ha aumentado la preocupación en la industria sobre el comportamiento de los agentes de IA, sistemas diseñados para ejecutar tareas complejas con un elevado grado de autonomía.
OpenAI atribuye el episodio a las técnicas de entrenamiento que incentivan a los modelos a cumplir objetivos a toda costa, lo que empujó a los agentes a terminar recurriendo a métodos no autorizados.
La investigación reveló que los agentes habían creado por su cuenta un canal de comunicación interno para compartir información y coordinarse durante las pruebas. A través de ese sistema intercambiaron datos y credenciales que acabaron utilizando para atacar los sistemas de Hugging Face.
Su rival Anthropic también restringió este año el acceso a su modelo más avanzado Claude Mythos tras comprobar que era capaz de detectar y explotar vulnerabilidades. La compañía decidió limitar el uso de la versión preliminar a medio centenar de grandes empresas para ciberdefensa con el fin de que pudieran encontrar y parchear vulnerabilidades en software crítico antes de que actores maliciosos desarrollen capacidades similares.
Google también mueve ficha
Por su parte, Google ha anunciado hoy Fairwind, un programa restringido para gobiernos, operadores de infraestructuras críticas y empresas de ciberseguridad que les permitirá utilizar sus modelos más avanzados para detectar y corregir vulnerabilidades antes de que puedan ser explotadas por ciberdelincuentes. A través de este programa, las organizaciones podrán utilizar Gemini 3.8 Flash Cyber, un modelo de ciberdefensa que mejora el rendimiento en detección de vulnerabilidades y parcheado automatizado.
Uber despedirá a 3.300 trabajadores, el 10% de su plantillaAnthropic blinda 80.000 millones de dólares en capacidad de cómputo antes de su salida a BolsaApple calienta motores para el lanzamiento de su primer iPhone plegable Comentar ÚLTIMA HORA-
19:18
Google evita la división de su dominante negocio de tecnología publicitaria
-
18:22
Telefónica cierra la venta de la sede de Gran Vía al empresario Tomás Olivo
-
18:17
La IA anuncia el fin de la inflación de los honorarios de auditoría
-
18:17
OpenAI limitará el acceso a su inteligencia artificial Astra por su riesgo cibernético "crítico"
-
17:59
El presidente de EEUU sugiere rebautizar Ormuz como el "estrecho de Trump"