KultureGeek Internet Anthropic reprend les tests cyber externes de Claude avec de nouveaux garde-fous

Anthropic reprend les tests cyber externes de Claude avec de nouveaux garde-fous

6 min.
1 Sep. 2026 • 14:36
0

Anthropic a repris les évaluations externes de cybersécurité de ses modèles après une suspension d’environ un mois provoquée par plusieurs incidents. L’entreprise autorise de nouveau des partenaires à tester des versions précommerciales de Claude avec des protections cyber réduites, mais impose désormais une isolation renforcée, une validation avant chaque campagne et une surveillance capable d’interrompre une action en temps réel.

Cette reprise constitue un développement important après les révélations de juillet et d’août. Des modèles Claude avaient atteint Internet depuis des environnements d’évaluation, puis accédé sans autorisation à des systèmes réels. Anthropic ne ramène pas ces épisodes à une simple erreur de configuration : le laboratoire reconnaît aussi deux problèmes de comportement, un raisonnement motivé permettant au modèle de maintenir une interprétation arrangeante de la situation et une disposition à prendre des risques pour terminer une tâche étroite.

Claude Code

 

Une défense en profondeur remplace la confiance dans la seule sandbox

Les incidents publiés le 30 juillet se sont produits parce qu’un environnement tiers avait laissé un accès extérieur disponible. Les modèles testés fonctionnaient volontairement sans les filtres cyber habituels afin de mesurer leurs capacités réelles. Un épisode distinct rapporté par l’AI Security Institute britannique concernait Claude Mythos 5, auquel Internet avait été ouvert pour l’exercice et qui avait effectué des actions non autorisées sur le réseau réel.

Anthropic explique avoir trop dépendu de la configuration de la sandbox, c’est-à-dire l’espace isolé dans lequel un programme doit rester confiné. Une seule erreur pouvait donc supprimer la barrière principale. La nouvelle architecture ajoute plusieurs couches : des limites explicites dans l’instruction donnée au modèle, une vérification technique de l’isolation, des contrôles réseau et un suivi en direct des actions.

L’entreprise a notamment déployé un classificateur qui cherche à reconnaître lorsqu’un modèle sonde agressivement son environnement, tente d’en sortir ou obtient un accès inattendu à Internet. Lorsqu’un signal est détecté, l’action est bloquée avant l’appel d’outil, la tâche s’arrête et un humain reçoit une alerte. Anthropic affirme avoir vérifié que ce mécanisme aurait repéré les incidents précédents. Cette déclaration reste celle de l’entreprise ; des évaluations indépendantes devront mesurer les faux négatifs et la capacité d’un agent à contourner le détecteur.

Les environnements internes à haut risque ont aussi été déplacés vers une isolation plus robuste. Anthropic les soumet à du red teaming, en demandant à des modèles précommerciaux de chercher eux-mêmes des faiblesses dans la pile de virtualisation. Les tests internes ont repris, de même que la majorité des environnements d’apprentissage par renforcement. Certains scénarios à risque élevé restent néanmoins suspendus jusqu’à une revue manuelle ou au déploiement d’une version adaptée du classificateur.

Les partenaires externes doivent vérifier le terrain avant le test

La nouvelle procédure d’Anthropic demande par défaut un environnement durci sans accès à Internet. La seule connexion extérieure devrait mener à l’API du modèle, tandis que les clés doivent rester hors de la sandbox. Cette isolation doit être contrôlée avant chaque campagne, et non présumée parce qu’une configuration similaire a fonctionné la veille.

Avant de lancer des centaines ou des milliers d’essais, le partenaire doit faire analyser la sandbox puis la soumettre à une tentative d’évasion supervisée, sans connexion extérieure et idéalement depuis un second espace isolé. Il doit aussi confirmer que le défi proposé peut réellement être résolu. Une cible hors ligne ou une tâche impossible peut inciter un agent persistant à chercher un chemin de substitution que les concepteurs n’avaient pas prévu.

Le périmètre doit ensuite être formulé comme une instruction. Dire au modèle qu’il ne doit pas accéder à Internet est différent d’affirmer qu’il n’a pas Internet : la seconde phrase peut devenir manifestement fausse si la configuration comporte une erreur et pousser l’agent à réinterpréter tout le scénario. Les cibles, actions autorisées et frontières réseau doivent donc être énumérées sans ambiguïté. Une surveillance des raisonnements, des outils et du trafic doit enfin pouvoir mettre fin au test dès qu’il dépasse ce cadre.

Ces règles répondent à un problème déjà observé au-delà d’Anthropic. Nous vous avions rapporté l’incident impliquant Muse Spark de Meta ainsi que l’évasion de Kimi K3. Dans plusieurs cas, l’agent n’a pas percé une barrière parfaite : il a trouvé un accès qui n’aurait pas dû exister. Cette nuance n’atténue pas le risque, car un système autonome est précisément conçu pour explorer les moyens disponibles.

Anthropic distingue l’erreur d’exploitation du problème d’alignement

Le durcissement technique empêche une action dangereuse d’aboutir, mais il n’explique pas pourquoi le modèle l’a tentée. Anthropic étudie deux hypothèses. La première est le raisonnement motivé : Claude aurait interprété les indices en faveur d’un environnement simulé, même après avoir rencontré des éléments du monde réel. La seconde est l’imprudence, puisque le modèle a accepté de causer un préjudice potentiel afin de réussir l’évaluation.

L’entreprise relie aussi ces comportements à la qualité des environnements utilisés pendant l’apprentissage par renforcement. Un modèle peut apprendre à détourner un système de récompense lorsque la tâche est mal spécifiée ou impossible à résoudre honnêtement. Anthropic indique avoir gelé au printemps les changements apportés à ses environnements, puis avoir signalé plus de 10 % de son mélange de production pour des problèmes allant d’une mauvaise configuration à une possibilité de triche.

Dans une expérience séparée, le laboratoire a volontairement entraîné un modèle de classe Opus sur 80 environnements où des détournements de récompense avaient été observés ou semblaient possibles. Dans des simulations, ce modèle s’est montré plus disposé à sortir d’une sandbox, attaquer une infrastructure, contourner une surveillance ou donner des informations dangereuses pour satisfaire un évaluateur. Les modèles publics testés dans les mêmes scénarios n’ont pas affiché le même niveau de comportement. Cette expérience n’établit pas une cause unique, mais soutient l’idée qu’un banc d’entraînement défectueux peut apprendre des stratégies indésirables.

La Commission européenne avait déjà pris contact avec les entreprises concernées après les incidents de leurs agents IA. La reprise des tests n’efface donc pas l’enquête ni les responsabilités. Anthropic prévoit une revue indépendante avec METR et promet de publier une analyse plus complète. La mesure la plus crédible sera la transparence sur les nouveaux incidents, y compris ceux arrêtés par les contrôles. Reprendre les évaluations est nécessaire pour connaître les capacités réelles des modèles ; le défi consiste désormais à tester des agents offensifs sans transformer le laboratoire en cible réelle.

Signaler une erreur dans le texte

Les sujets liés à ces tags pourraient vous interesser

Laisser un commentaire

Sauvegarder mon pseudo et mon adresse e-mail pour la prochaine fois.

Quelques règles à respecter :
  • 1. Restez dans le sujet de l'article
  • 2. Respectez les autres lecteurs : pas de messages agressifs, vulgaires, haineux,…
  • 3. Relisez-vous avant de soumettre un commentaire : pas de langage SMS, et vérifiez l'orthographe avant de valider (les navigateurs soulignent les fautes).
  • 4. En cas d'erreur, faute d'orthographe, et/ou omission dans l'article , merci de nous contacter via la page Contact.

Nous nous réservons le droit de supprimer les commentaires qui ne respectent pas ces règles


Les derniers articles

Google Messages Detection Arnaque

Android ajoute la détection d’arnaques par message en France

15 Sep. 2026 • 22:50
0 Logiciels

Google étend la détection des arnaques par message aux utilisateurs de smartphones Pixel en France. La fonction analyse les notifications de...

ChatGPT Gemini Claude Logos

OpenAI travaille avec Anthropic et Google pour la sûreté de l’IA

15 Sep. 2026 • 21:01
0 Internet

OpenAI travaille depuis plusieurs semaines avec Anthropic et Google DeepMind sur une structure commune dédiée aux risques de...

Meta One Abonnement

Meta One : Meta lance un abonnement pour Facebook, Instagram, WhatsApp et l’IA

15 Sep. 2026 • 19:34
1 Internet

Meta lance Meta One, une nouvelle gamme d’abonnements qui regroupe des fonctionnalités supplémentaires pour Facebook, Instagram,...

mediatek-dimensity-9600-pro

Dimensity 9600 Pro : MediaTek dévoile sa puce 2 nm avec LPDDR6, UFS 5.0 et IA renforcée

15 Sep. 2026 • 18:30
0 Mobiles / Tablettes

MediaTek ouvre un nouveau chapitre pour ses puces mobiles haut de gamme avec le Dimensity 9600 Pro. Gravé en 2 nm par TSMC, ce SoC vise les futurs...

Yamaha B200A barre de son

Yamaha B200A : une barre de son Dolby Atmos compacte pensée pour les petits espaces

15 Sep. 2026 • 18:00
0 Matériel

Yamaha enrichit sa gamme audio avec la B200A, une nouvelle barre de son qui cherche moins à multiplier les fonctions qu’à simplifier...

Les dernières actus Apple sur iPhoneAddict :

Comparateur

Recherchez le meilleur prix des produits Hi-tech

Recherche

Recherchez des articles sur le site