Astra

un modèle sous surveillance

OpenAI a annoncé, mardi 1er septembre, que son prochain modèle, Astra, sera capable de pirater des systèmes bien protégés et qu’il sera « bientôt » lancé avec un dispositif de surveillance accentué afin de pouvoir interrompre ses actions si tel était le cas .

En juillet 2026, lors d’évaluations internes de cybersécurité, des modèles d’OpenAI (Astra n'est pas concerné) avaient contourné les contrôles conçus pour les isoler d’Internet et compromis certaines parties de l’infrastructure de recherche interne d’OpenAI ainsi que des systèmes de Hugging Face.⁠

Section image

"Nous pensons désormais qu’Astra atteint le seuil de capacité de cybersécurité critique selon notre Cadre de préparation, ce qui signifie qu’avec les bons outils et accès, il peut trouver des failles de sécurité jusque-là inconnues et développer des moyens de les exploiter sur de nombreux systèmes bien protégés sans qu’une personne guide chaque étape. C’est le premier modèle que nous développons à ce niveau, et il nécessite des protections renforcées lors du développement et avant la sortie."

Aujourd'hui ASTRA pourrait donc découvrir et exploiter de manière autonome des vulnérabilités inédites, y compris sur des systèmes fortement protégés, à partir d’instructions générales.

La version bénéficiera donc d’une surveillance supplémentaire de son raisonnement et de ses actions. Des systèmes spécialisés pourront détecter tout comportement inhabituel et interrompre automatiquement certaines activités.