Des leaders de l’IA proposent les directives SAFE pour la transparence en matière de cybersécurité

La Linux Foundation publie un appel à commentaires sur les directives Shared AI Findings Exchange (SAFE), destinées à transformer les incidents de cybersécurité agentique en une meilleure protection.
by

Les membres de l’Open Secure AI Alliance — qui compte désormais plus de 120 organisations — élaborent de nouvelles directives visant à renforcer la cybersécurité de l’IA agentique, alors que la conférence annuelle Black Hat s’ouvre aujourd’hui à Las Vegas.

La Linux Foundation a publié aujourd’hui un appel à commentaires sur le Shared AI Findings Exchange (SAFE), un ensemble de directives proposé pour transformer les incidents de cybersécurité agentique en une protection partagée au bénéfice de l’ensemble de l’écosystème.

Les directives SAFE sont rédigées par un groupe de travail de l’Open Secure AI Alliance. NVIDIA, Cisco, CrowdStrike, Hugging Face, et Red Hat font partie des membres de l’Open Secure AI Alliance qui collaborent avec la Linux Foundation afin de contribuer à la proposition initiale.

Les directives SAFE comprennent des propositions visant à collecter et analyser de manière confidentielle les incidents et quasi-incidents liés à l’IA, à informer les parties concernées, à identifier les défaillances récurrentes des contrôles et à publier des recommandations opérationnelles fondées sur des preuves permettant de réduire le risque systémique.

La cybersécurité est une course sans ligne d’arrivée. Chaque grande transition technologique a créé de nouvelles surfaces d’attaque potentielles. Les défenseurs doivent désormais agir à la vitesse des agents pour réagir rapidement et protéger les infrastructures et la propriété intellectuelle, et la meilleure manière d’y parvenir est de le faire ensemble. Lorsque des écosystèmes de confiance partagent ouvertement leurs renseignements sur les menaces, la défense collective devient un multiplicateur de force.

L’Open Secure AI Alliance livre davantage d’outils pour la cybersécurité de l’IA

Le cadre SAFE s’ajoute aux contributions technologiques que les membres de l’Open Secure AI Alliance apportent dans le cadre d’un engagement commun à créer et à partager des outils ouverts et inspectables sur l’ensemble de la pile de sécurité de l’IA.

Un agent d’IA n’est pas seulement un modèle. C’est un système — contrôles d’identité, harnais, garde-fous, journaux et évaluation — et sa sécurisation exige davantage qu’une simple analyse des vulnérabilités.

La sécurité a toujours été la plus robuste dans la superposition des couches, ainsi que dans la volonté de la communauté de partager ce qu’elle sait. Les problèmes les plus difficiles se résolvent lorsque les défenseurs apprennent les uns des autres, ouvertement et rapidement.

Une pile complète de logiciels et de modèles de cybersécurité NVIDIA ouverts

Les contributions de NVIDIA s’étendent sur toute la longueur de la pile, en commençant par le NVIDIA LabsObject-Oriented Agent (NOOA) harnais de recherche, sur GitHub — qui facilite les tests, le suivi, l’audit et la gouvernance du comportement des agents.

L’environnement d’exécution NVIDIA OpenShell restreint ce qu’un agent peut voir, toucher et faire, en appliquant des contrôles de sécurité et de confidentialité au niveau de l’agent, afin qu’un agent ne puisse pas atteindre ce à quoi il ne devrait pas accéder.

Les familles de modèles ouverts de NVIDIA — NVIDIA Nemotron pour l’IA agentique, NVIDIA Cosmos pour l’IA physique, NVIDIA Isaac GR00T pour la robotique, NVIDIA BioNeMo pour la santé et les sciences de la vie, et NVIDIA Alpamayo, le plus grand modèle au monde destiné aux véhicules autonomes sous licence d’utilisation commerciale— sont fournies avec des poids, des jeux de données et des techniques d’entraînement ouverts.

Les compétences d’agent vérifiées open source de NVIDIA étendent cette confiance à la couche des capacités.

Chaque compétence fournit des ensembles d’instructions portables : catalogués, analysés afin de détecter les risques tels que l’injection de prompt et l’empoisonnement d’outils, signés cryptographiquement et documentés au moyen d’une fiche de compétence. Les équipes de défense savent exactement ce que fait une compétence d’agent, d’où elle provient et si elle a été modifiée après sa publication.

NeMo Guardrails, NeMo Anonymizer et NeMo Safe Synthesizer contribuent à appliquer les politiques de sécurité, à protéger les données sensibles et à générer des données synthétiques respectueuses de la confidentialité.

Et Garak, le scanner de vulnérabilités des LLM open source de NVIDIA, permet aux équipes de sécurité de rechercher dans les modèles les fuites de données, les injections de prompt et les scénarios de contournement avant toute mise en production.

Les membres de l’Alliance enrichissent les outils pour le développement d’un écosystème ouvert

D’autres membres de l’Open Secure AI Alliance ont également développé des solutions sur l’ensemble de la pile défensive, couvrant l’identité et les autorisations, les harnais, les garde-fous d’exécution, les modèles d’IA de sécurité, l’observabilité et l’évaluation, la sécurité et la confidentialité des données, la disponibilité et la résilience, entre autres.

Certaines des contributions les plus récentes aux différentes couches de la pile sont présentées ci-dessous, et d’autres continuent d’arriver.

Identité et autorisations : qui est autorisé à agir

Il est impossible de sécuriser ce que l’on ne peut pas identifier.

Okta développe des implémentations de référence pour l’identité et l’accès des agents, montrant comment Cross App Access (XAA), un protocole ouvert, permet aux agents IA opérant dans des environnements sandbox OpenShell de se connecter en toute sécurité aux applications d’entreprise.

Palo Alto Networks a contribué des outils open source issus d’Idira, sa plateforme de sécurité des identités de nouvelle génération, notamment Agent Guard et Agent Watch. Ces outils aident les développeurs et les créateurs d’agents à appliquer les bonnes pratiques de sécurité des identités ainsi que des mesures de protection telles que la récupération sécurisée des secrets pour les workflows agentiques.

Un nouveau projet open source fondé par Red Hat, asago reprend les exigences de gouvernance personnalisées d’une organisation — telles que celles référencées par le NIST, l’OWASP et l’AI Act européen — et les met directement en correspondance avec ce que les agents sont autorisés à faire lors de l’exécution, avec une piste d’audit unique allant de la clause de politique au contrôle actif.

Harnais et outillage :comment le travail de sécurité est orchestré

Les agents IA sont bien plus qu’un modèle : ils s’appuient sur des ensembles de modèles ouverts et fermés, de harnais, d’outils et d’environnements d’exécution pour accomplir leurs tâches.

Si le modèle constitue le cerveau de l’agent, le harnais est le corps qui agit en utilisant des outils. Le harnais entourant le modèle joue le rôle d’un orchestrateur qui détermine la manière dont les agents sont déployés, coordonnés et encadrés.

Les membres de l’Alliance contribuent à l’outillage, aux harnais et aux technologies de support de cette couche émergente de la pile de sécurité de l’IA.

Amazon, qui est devenu aujourd’hui l’un des plus récents membres de l’Open Secure AI Alliance, apporte Strands Agents, une boîte à outils open source destinée à créer des agents IA, ouverte à chaque niveau, qui offre aux développeurs une visibilité complète sur le comportement des agents ainsi que la capacité d’évaluer les systèmes agentiques en production. Amazon apporte également Cedar, un langage d’autorisation open source qui impose des limites déterministes et vérifiables aux actions permises aux agents IA, offrant aux clients des contrôles d’accès granulaires et analysables afin de garantir que seules les actions autorisées atteignent les ressources de l’entreprise.

Capital One a publié en open source VulnHunter pour la sécurité du code d’IA agentique.

Cloudflare propose son Vulnerability Discovery Harness sous forme de compétence open source afin de renforcer la sécurité des systèmes d’agents.

Microsoft AI Red Team a publié en open source plusieurs outils et harnais de test. PyRIT – Python Risk Identification toolkit permet aux équipes de red teaming en IA de mener des opérations de red teaming automatisées, avec une mémoire intégrée, en prenant en charge les cibles courantes ainsi que les points de terminaison personnalisés.

RAMPART transforme les conclusions des équipes red team et les incidents réels en tests reproductibles qui s’exécutent au rythme des modifications logicielles. Clarity aide les équipes à remettre en question les hypothèses de conception et à identifier les défaillances potentielles avant l’écriture du code.

Microsoft a également publié en open source Assert, qui convertit les exigences exprimées en langage naturel et les comportements attendus en matière de sûreté et de sécurité de l’IA en évaluations exécutables.

Atlas est le moteur de Wiz dédié à la recherche autonome de vulnérabilités,qui orchestre des agents IA spécialisés afin de détecter et de valider les failles de sécurité dans le code et les paquets open source.

Visa a également rejoint l’Open Secure AI Alliance, en apportant son outil open source Visa Vulnerability Agentic Harness afin d’aider les équipes à identifier les problèmes et à soutenir la remédiation et la validation, rapidement et en toute sécurité.

Modèles — Une intelligence conçue pour la sûreté et la défense de l’IA

Toutes les tâches de sécurité ou de sûreté ne nécessitent pas un modèle à usage général.Les modèles spécialisés en sécurité et en sûreté sont conçus spécifiquement pour la défense : ils sont entraînés à comprendre le code, à localiser les vulnérabilités et à raisonner sur les menaces à grande échelle. Ils peuvent contribuer à la prise en charge des flux de travail agentiques sous forme de systèmes de modèles, où des modèles ouverts et fermés collaborent pour accomplir la tâche avec efficacité.

Cisco Defense Claw est une couche de gouvernance agentique open source qui s’appuie sur NVIDIA OpenShell pour offrir une sécurité robuste et automatisée au niveau de l’exécution lors de la montée en échelle des effectifs agentiques. Cisco a également publié deux de ses petits modèles de langage de sécurité Antares afin d’aider à repérer précisément l’emplacement des vulnérabilités connues au sein d’une base de code ; ainsi que Project CodeGuard, destiné à intégrer des pratiques sécurisées par défaut directement dans les flux de travail de codage assisté par IA.

CrowdStrike affine le modèle NVIDIA Nemotron Nano pour la cyberdéfense. Les tests internes ont atteint une précision de 96 % dans la génération de requêtes d’investigation au sein de Falcon LogScale, offrant une interface en langage naturel qui accroît l’efficacité des investigations menées par les agents. CrowdStrike a également publié des travaux de recherche démontrant comment un modèle de raisonnement NVIDIA Nemotron Nano spécialisé surpasse des modèles bien plus volumineux dans le tri des détections au sein d’un centre des opérations de sécurité, tout en introduisant un indice de confiance calibré fondé sur les logits afin de permettre des décisions de sécurité autonomes mesurables, ajustables et auditables.

Mistrala publié aujourd’hui son nouveau modèle de classification de sûreté multimodal Shieldstral en poids ouverts sous licence Apache 2.0.

Observabilité et évaluation — après l’action de l’agent

Observer ce qu’un agent a fait ne représente qu’une partie du tableau. Les défenseurs doivent également comprendre pourquoi il a agi, si le système se comporte de manière sûre et comment les attaques évoluent dans le monde réel.

Akamai apporte les enseignements tirés de ses rapports State of the Internet et travaux de recherche du Security Intelligence Group, en s’appuyant sur des données réelles pour éclairer les menaces de l’ère de l’IA et expliquer le fonctionnement des exploits émergents, afin que les défenseurs puissent apprendre, s’adapter et réagir. Cognition a publié une évaluation de la fiabilité, qui mesure les risques d’alignement et de sécurité des modèles dérivés de l’open source. Cette évaluation démontre que ces risques peuvent être atténués grâce au post-entraînement.

Numbat est la suite open source de Perplexity pour la sécurité des agents sur les points de terminaison client. Elle détecte, examine et prévient l’activité des agents sous macOS, Linux et Windows, offrant ainsi aux défenseurs un enregistrement structuré de ce que les agents ont réellement fait.

Uber a publié en open source des composants clés d’ADR (Agentic AI Detection and Response), un système de production qui reconstitue l’intégralité de la chaîne causale de l’activité des agents d’IA — du prompt au raisonnement, aux appels d’outils et aux résultats — afin d’aider les équipes de sécurité à détecter les menaces. Aujourd’hui, ADR prend en charge plus de 200 000 sessions d’agents par jour sur 30 000 points de terminaison, en recourant à une approche d’analyse à deux niveaux qui associe une détection efficace à des investigations plus approfondies pour les menaces à haut niveau de confiance.

Disponibilité et résilience : une reprise rapide lorsque chaque instant compte

Les systèmes d’agents doivent rester fiables en cas de perturbation, circonscrire les défaillances et se rétablir en toute sécurité, sans perdre d’état critique ni exposer l’environnement plus large.

LangChain ajoute des capacités de résilience à ses frameworks open source — Deep Agents, LangGraph et LangChain — permettant aux agents de reprendre les tâches interrompues, de suivre un chemin de reprise sûr, de repartir d’un état enregistré au lieu de recommencer à zéro et de basculer automatiquement vers d’autres modèles lorsque le modèle principal est défaillant.

Veeam aide les organisations à préserver la résilience et la récupérabilité des données et de l’infrastructure qui sous-tendent l’IA, grâce à des technologies telles que Kanister, son framework open source de protection des données sur Kubernetes. Il aide les équipes à protéger et à restaurer les charges de travail d’IA, les bases de données vectorielles et les données vers un état sain vérifié.

D’autres contributions suivront. Lorsque les membres publient des mesures d’atténuation réutilisables, les défenseurs de l’ensemble de l’écosystème peuvent les examiner, les adapter et les améliorer, ce qui permet aux pratiques de sécurité d’évoluer au rythme des progrès de l’IA.

Rejoignez les membres de l’Open Secure AI Alliance à Black Hat aujourd’hui, mardi 4 août, à 2h15 CEST, pour une photo de groupe à l’extérieur de la Main Stage, Business Hall, au Mandalay Bay Convention Center.

En savoir plus ou manifester votre intérêt pour rejoindre l’Open Secure AI Alliance.