Sécurité IA : un "kill switch" pour sécuriser les infrastructures critiques en Belgique ?

Les comportements inquiétants des modèles d'IA se succèdent à un rythme de métronome. Entre agents qui se mutinent contre leurs propres instructions et les tentatives de « piratage mutuel » entre entreprises, la question est lancée : faut-il mettre en place en place un cadre de sécurité obligatoire comparable aux normes de sécurité pour les jouets ou les voitures ? Jack Clark, co-fondateur d'Anthropic, propose un "kill switch" en cas de danger imminent. Mais la question soulève d’autres points tout en questionnant sa faisabilité au niveau belge ou européen.
Le co-fondateur d'Anthropic, Jack Clark, est récemment sorti du bois suite à une actualité saturée autour de la protection des agents rebelles. Avec une idée : les législateurs devraient peut-être obliger les entreprises d'IA à intégrer un "kill switch" vérifiable par des tiers dans leurs systèmes d'IA. Le patron américain fait ainsi référence à des comportements inquiétants déjà observés cette année sur des modèles d'IA, allant d'agents qui se sont coordonnés à l'encontre de leurs propres instructions à des tentatives de "piratage" mutuel entre entreprises. Il plaide dès lors pour un cadre avec des tests de sécurité obligatoires, comparables aux normes de sécurité pour les jouets et les voitures.
Un bouton d'urgence centralisé à grande échelle : une cible idéale pour les pirates
Dans les semaines à venir, Anthropic fera appel à des auditeurs externes pour évaluer la question en interne. Mais la proposition est déjà critiquée : le gouvernement britannique la juge potentiellement inefficace sans une coordination mondiale.
Une première réaction est venue de Graeme Stewart, Head of Public Sector chez Check Point UK, qui qualifie « un interrupteur d'urgence pour l'IA ancré dans la loi d'étape sérieuse, mais pose la question de l’activation de cette responsabilité finale ». En effet, qui appuiera sur l’interrupteur le moment opportun : le fournisseur, le gouvernement, l'autorité de régulation ? Et il prévient « qu'un bouton d'urgence centralisé et à grande échelle est précisément le type de cible que les pirates adorent, à moins que la sécurité ne soit intégrée dès le premier jour plutôt qu'ajoutée après coup ».
Fred Streefland, expert en cybersécurité et Global CISO chez Check Point, partage cet avis, tout en apportant quelques nuances. « Un « kill switch » pourrait être envisagé en tout dernier recours, seulement lorsque d'autres mesures de sécurité ont déjà échoué ». Le mot se suffit à lui-même : un arrêt d'urgence uniquement en cas d'extrême nécessité.

L’expert précise son idée : « tout interrupteur d'urgence intégré quelque part devient immédiatement une cible attrayante pour ceux qui veulent en abuser, et il devra être conçu avec soin, avec des responsabilités claires confiées à un nombre limité de personnes ».
Ne confondez pas « construire une technologie » et la « sécuriser »
Fred Streefland plaide en revanche pour une sécurisation de l'IA dès sa conception : « une tâche qui devrait être réalisée par des acteurs dont la sécurité est l'expertise principale, et non une préoccupation secondaire à côté de la construction de modèles toujours plus puissants ».
L’expert appelle d’ailleurs à ne pas tomber dans un discours alarmiste. « Des entreprises comme Anthropic et OpenAI sont phénoménalement douées pour développer des modèles de pointe ; les fuites que nous avons vues précédemment, notamment chez Hugging Face, montrent que la sécurité est encore trop souvent une réflexion après coup plutôt qu'un point de départ ».
Fred Streefland souligne ainsi une distinction importante entre ceux qui construisent une technologie et ceux qui la sécurisent. Il aime comparer cela à la construction d'un avion de chasse. « Le fabricant conçoit et construit l'appareil : aérodynamique, propulsion, avionique, etc., en se concentrant sur la capacité et les performances. Mais cet appareil ne devient vraiment opérationnel que grâce à une partie externe qui se consacre exclusivement à la sécurisation de ces mêmes systèmes : pensez à la détection des menaces, à la gestion des identités et des accès, à la gestion des vulnérabilités, au logiciel sécurisé. Ce sont tout simplement deux disciplines complètement différentes, chacune étant tout aussi déterminante pour la réussite de la mission ».
Cette analyse rejoint une recherche menée par Check Point Research plus tôt cette année qui montrait qu’une seule personne, secondée par l'IA, était parvenue à construire en une semaine un cadre d'attaque complet (environ 88.000 lignes de code) qui aurait nécessité six mois de travail pour une équipe auparavant. « Des vulnérabilités qui prenaient autrefois 30 jours à trouver et à exploiter sont désormais exploitables en environ 21 heures », résume Fred Streefland.
Bref, une problématique qui devient très concrète pour les organisations à l’heure des grandes préparations à la directive NIS2 et aux déploiements massifs des assistants IA.