Quelques semaines après la controverse autour de son modèle Claude Fable 5, Anthropic a dévoilé un nouveau référentiel destiné à mesurer la gravité des failles de sécurité affectant les modèles d’intelligence artificielle.
Baptisé Cyber Jailbreak Severity (CJS), ce cadre d’évaluation vise à distinguer les vulnérabilités réellement critiques des détournements plus limités. Une initiative qui pourrait rapidement devenir une référence, alors que les modèles d’IA sont appelés à intervenir dans des secteurs sensibles comme la santé.
Un langage commun pour évaluer les détournements de l’IA
Un jailbreak consiste à contourner les garde-fous d’un modèle afin de lui faire produire des réponses qu’il est normalement censé refuser : génération de codes malveillants, aide à une cyberattaque ou divulgation d’informations sensibles.
Jusqu’à présent, aucune méthode commune ne permettait d’évaluer la gravité de ces détournements. Toutes les vulnérabilités étaient souvent placées sur le même plan, qu’elles permettent un simple contournement ponctuel ou qu’elles offrent des capacités offensives inédites à un attaquant.
Pour répondre à cette limite, Anthropic propose le Cyber Jailbreak Severity, une échelle de cinq niveaux (CJS-0 à CJS-4) qui mesure non seulement la réussite technique d’un jailbreak, mais surtout son impact potentiel dans le monde réel. Le score repose sur quatre critères : le gain de capacités offert à l’attaquant, l’étendue des usages possibles, la facilité de reproduction de l’attaque et les conséquences concrètes qu’elle pourrait entraîner. L’objectif est de disposer d’un référentiel partagé pour prioriser les corrections et faciliter les échanges entre développeurs, chercheurs et autorités.
Une réponse à la polémique autour de Claude :
Cette initiative intervient après plusieurs semaines de débats autour de Claude Fable 5. Des chercheurs avaient affirmé avoir identifié un jailbreak permettant de contourner certaines protections du modèle, au point de susciter l’intervention des autorités américaines. Anthropic estimait de son côté que la faille restait limitée et ne justifiait pas les mesures prises.
Le CJS cherche précisément à éviter ce type de désaccord en proposant une méthode plus objective pour qualifier les vulnérabilités, plutôt que de les décrire de manière binaire comme « critiques » ou « non critiques ».
Un enjeu croissant pour les usages en santé
Si cette démarche concerne avant tout la cybersécurité, elle intéresse directement le secteur de la santé. Les établissements de santé commencent à intégrer des modèles d’IA dans des usages sensibles : assistants médicaux, aide à la décision clinique, analyse documentaire ou encore exploitation des entrepôts de données de santé. À mesure que ces modèles accèdent à des informations stratégiques, leur robustesse devient un enjeu de gouvernance.
L’émergence d’indicateurs comme le Cyber Jailbreak Severity pourrait ainsi contribuer à l’évaluation des risques des systèmes d’IA déployés dans les environnements hospitaliers, en complément des exigences du règlement européen sur l’IA (AI Act) et du futur Espace européen des données de santé (EHDS). Plus largement, cette initiative illustre l’évolution des modèles d’IA : au-delà de leurs performances, leur capacité à résister aux tentatives de détournement devient désormais un critère central de confiance.

