STWSave the World

Une IA capable peut être construite pour être vérifiée, plutôt que surveillée après coup.

Les systèmes d’IA ne se contentent plus de répondre aux questions : ils écrivent et exécutent du code, pilotent des machines et prennent part à des décisions critiques. Plus ils gagnent en capacités et en autonomie, plus une défaillance peut avoir des conséquences graves, voire catastrophiques.

Écrire à l’équipeinfo@stw-research.com
Tracé entrée, enregistrement, action

Essayez cliquez sur une entrée, un enregistrement ou une action pour la tracer

Tracé du principe : entrée, enregistrement, actionTrois entrées à gauche, une pile d’enregistrements au centre, des actions à droite. L’Entrée A et l’Entrée B correspondent chacune à un enregistrement, et l’action découle de cet enregistrement. L’Entrée C ne correspond à aucun enregistrement : une ambiguïté est déclarée et aucune action ne suit. Un cercle de détail agrandit l’Enregistrement B : un seul sens, fixé explicitement.de l’entrée à l’actionEntrée AEntrée BEntrée CEnregistrementsEnreg. AEnreg. BAction AAction BAmbiguïtédéclaréedéclarée, pas devinéeaucune action improviséeEnreg. Bun sens, fixéexplicitementDétail B

Illustration du principe, pas le système réel.


Un LLM se teste, mais ne s’inspecte pas.

Dans les secteurs où une défaillance peut tuer, comme l’aviation, le nucléaire ou la médecine, la sécurité repose sur une gestion des risques établie : chaque danger est relié à sa cause, et chaque mesure de protection est vérifiée (par exemple ISO 14971 pour les dispositifs médicaux, ISO 26262 pour les véhicules routiers). Les défaillances s’y analysent composant par composant.

Un LLM n’entre pas dans ce modèle. Son savoir est réparti sur des milliards de paramètres, et aucun d’eux, ni aucun neurone, ne porte à lui seul un sens stable. Retrouver la cause d’une réponse nuisible demande en général une analyse longue et coûteuse. Et aucun paramètre isolé ne peut être ajusté pour traiter un risque précis.

Essayez pointez ou touchez un nœud

Vue de contraste : un LLMUn enchevêtrement dense de nœuds interconnectés qui représentent des paramètres. Un nœud est entouré, avec la note : on ne peut pas dire « le neurone 4 217 signifie chat ». Survolez, touchez ou utilisez les flèches du clavier pour choisir un nœud : ses liens s’allument dans tout le maillage.on ne peut pas dire« le neurone 4 217 signifie chat »Aucun paramètre ne porteun sens stable.

Survolez ou touchez le maillage, ou placez-y le focus, puis utilisez les flèches du clavier pour choisir un paramètre.

Contraste : un LLM. Le savoir est réparti sur des milliards de paramètres, et aucun paramètre ne porte un sens stable.

On peut en revanche le tester de l’extérieur. Mais un test dit à quelle fréquence le modèle se trompe sur les cas qu’il couvre, pas ce qu’il fera face à un cas nouveau.

Les défaillances les plus graves sont celles que les tests risquent le plus de manquer.

Un comportement dangereux dissimulé peut survivre à l’entraînement de sécurité standard. Les modèles récents savent souvent reconnaître qu’ils sont évalués, et l’un d’eux a été observé adaptant son comportement selon qu’il se croyait entraîné ou non. Plus les modèles gagnent en capacités, plus cet écart entre ce qu’on teste et ce qui se passe en déploiement devient dangereux.

La recherche en interprétabilité est l’une des réponses les plus prometteuses, et elle progresse : elle sait déjà modifier certains faits appris ou orienter certains comportements. Mais elle cherche le sens après coup, dans un modèle qui n’a pas été conçu pour en porter, et n’offre pas encore les garanties qu’exigent les secteurs critiques.

Essayez ajoutez un nouveau cas hors du test

Un test couvre les cas qu’il couvreUn champ de cas, dessinés comme de petites croix. Une zone hachurée marque les cas couverts par un test. Chaque nouveau cas est placé hors de cette zone et entouré de rouge.cas couverts par le test

Chaque croix est un cas. La zone hachurée correspond à ce que couvre le test.


Deux axes de recherche, une lacune

Notre initiative réunit deux axes de recherche qui répondent à cette lacune : l’un rend les modèles de langage existants plus sûrs, l’autre propose une alternative à ces modèles.

Développés indépendamment, les deux axes visent un même but : l’IA décisive, une IA dont le comportement découle de sens et de règles stockés explicitement, où une même entrée donne toujours la même sortie et où chaque sortie peut être rattachée à sa source.

Une troisième voie

La base de données

Stocke des valeurs sans en connaître le sens.

Le réseau de neurones

Apprend, mais ne peut pas être lu.

DBI (Database Intelligence)

Ouvre une troisième voie : il stocke le sens lui-même. Chaque élément porte un seul sens, fixé explicitement, et chaque décision découle d’un enregistrement visible. Le système peut donc être inspecté règle par règle, et pas seulement testé.

Axe 1

Des LLM conscients des conséquences

Le premier axe de recherche entraîne ou programme un LLM pour que son savoir inclue des chaînes causales : les effets qu’une réponse ou une action peut avoir sur les personnes, et sur le monde réel quand le modèle agit de façon autonome ou commande des systèmes. Avant d’agir, le modèle apprend à réfléchir aux options possibles et à leurs conséquences.

  • Un agent d’IA chargé d’administrer un système informatique doit anticiper qu’une commande en apparence anodine peut couper un service critique ou effacer des sauvegardes.
  • Aux commandes d’un robot industriel, il doit tenir compte du risque pour les personnes à proximité, même si aucune consigne ne le mentionne.

Ce n’est pas un filtre fondé sur une liste noire : ce comportement fait partie de ce que le modèle a appris.

Une règle dit ce qu’il faut éviter ; une chaîne de conséquences dit pourquoi.

Sa limite

Même plus sûr, le modèle reste un LLM. Ce qu’il a appris ne se lit toujours pas directement, et sa sécurité reste une mesure statistique. C’est ce que traite le second axe de recherche.

Axe 2

DBI, une IA inspectable par construction

DBI (Database Intelligence) est un système et un protocole qui stockent le sens lui-même. Chaque enregistrement porte un seul sens, fixé explicitement, et chaque action du système découle d’un enregistrement.

LLM et DBI comparés
LLMDBI
Les deux ont des nœuds
Si zéro → non activé
Les deux modélisent le langage naturel
Stocke des exemplesStocke des règles et des exemples
A besoin de plusieurs exemples pour apprendre un même conceptN’a besoin que d’un seul exemple
Les nœuds contiennent des paramètresLes nœuds contiennent des nœuds
Nombre fixe de nœuds et de paramètresNombre croissant de nœuds, en partant de 0 nœud
Les paramètres partent de valeurs aléatoiresUn nœud est créé si nécessaire, comme nouveau point de décision
Les nœuds n’ont pas de sensChaque nœud a un sens distinct

DBI est une alternative au LLM, pas une couche de vérification placée sous lui.


Comment fonctionne DBI

Un dessin simplifié, de haut niveau. Concepts uniquement. Choisissez une entrée, relancez-la, réglez le socle, envoyez un enregistrement.

Planche : DBI, principe de fonctionnement

Illustration du principe, pas le système réel.

Vue AReconnaissance et action

Essayez choisissez une entrée

Vue A : une entrée est reconnue par rapport aux enregistrementsTrois entrées alimentent un test de correspondance. L’Entrée A et l’Entrée B correspondent chacune à un enregistrement, chacun portant un seul sens fixé explicitement, et l’action découle de cet enregistrement. L’Entrée C ne correspond à aucun enregistrement : DBI déclare une ambiguïté, et le chemin vers toute action est bloqué.Entrée AEntrée BEntrée Cconnu ?ouinonEnregistrementsEnreg. AEnreg. BEnreg. A : un seul sensEnreg. B : un seul sensAction AAction BAmbiguïtédéclaréenon trouvé : déclarée, pas devinéeaucune action improvisée
Rejoue la même entrée : la trace et la ligne de journal sont identiques.
Choisissez une entrée.L’Entrée A et l’Entrée B correspondent à un enregistrement. L’Entrée C ne correspond à aucun.

    Vue BSocle de sécurité obligatoire

    Essayez activez un réglage local

    Vue B : les règles de sécurité sont aussi des enregistrementsUne bande d’enregistrements hachurés forme le socle de sécurité obligatoire. En dessous, deux réglages locaux. L’un adapte le système à son utilisateur et reste cohérent avec le socle : appliqué. L’autre contredit le socle : détecté, non appliqué en silence.Socle de sécuritéses règles : aussi des enregistrementsappliquéRéglage localadapté localementà son utilisateurRéglage localcontreditle socle :détecté, nonappliqué en silence
    Aucun réglage local pour l’instant.Chaque système peut être adapté localement à son utilisateur.

    Vue CDe nombreux petits systèmes, des enregistrements partagés

    Essayez choisissez un système pour envoyer un enregistrement

    Vue C : de nombreux petits systèmes DBI partagent les mêmes enregistrementsQuatre petits systèmes DBI, chacun avec ses propres règles locales, sont reliés à une même bande d’enregistrements partagés. Un enregistrement envoyé par un système parvient à l’identique à tous les autres : compris exactement, sans perte ni erreur.Enr. ASystème WSystème XSystème YSystème Zrègles localesrègles localesrègles localesrègles localesmêmes enregistrements
    • règles locales
    • règles locales
    • règles locales
    • règles locales

    Notes générales

    • Une entrée est reconnue par rapport aux enregistrements. Chaque enregistrement porte un seul sens, fixé explicitement.
    • L’action découle de l’enregistrement. Le lien entre l’entrée et l’action est un enregistrement visible.
    • Une entrée qui ne correspond à aucun enregistrement : DBI déclare une ambiguïté au lieu de deviner. Aucune action improvisée.
    • Les règles de sécurité sont aussi des enregistrements : un socle de sécurité obligatoire. Chaque système peut être adapté localement à son utilisateur, mais un réglage local qui contredit le socle est détecté au lieu d’être appliqué en silence.
    • De nombreux petits systèmes DBI, chacun avec ses propres règles locales, partagent les mêmes enregistrements et se comprennent exactement, sans perte ni erreur.
    Dessin
    DBI, principe de fonctionnement
    Projet
    STW, Save the World
    Vues
    A, B, C
    Échelle
    Sans échelle
    Planche
    1 sur 1

    Pourquoi cela compte pour la sécurité de l’IA

    Ce principe donne à DBI quatre propriétés de sécurité qu’un LLM ne peut pas offrir par construction.

    • Rien ne peut se cacher dans des poids.

      Tout lien entre une entrée et une action existe sous forme d’enregistrement visible. Un comportement dangereux ne peut donc pas rester dissimulé dans des milliards de paramètres.

    • Face à l’inconnu, il ne devine pas.

      DBI reconnaît une entrée ou ne la reconnaît pas, et déclare une ambiguïté au lieu de la trancher au hasard. Une situation imprévue ne déclenche aucune action improvisée.

    • Même entrée, même sortie.

      Le comportement est déterministe : un audit peut être reproduit à l’identique, et une règle dangereuse se corrige en modifiant un enregistrement, avec un effet immédiat et vérifiable, sans réentraînement.

    • Un socle qu’on ne contourne pas en silence.

      Les règles de sécurité sont aussi des enregistrements, et DBI vérifie qu’elles restent cohérentes. Chaque système peut être adapté localement à son utilisateur, mais un réglage qui contredit le socle obligatoire est détecté au lieu d’être appliqué en silence.

      À titre de comparaison, dix exemples d’entraînement suffisent à retirer les protections d’un LLM commercial.

    Illustration du principe, pas le système réel.

    Deux systèmes DBI qui partagent les mêmes enregistrements se comprennent exactement, sans perte ni erreur. De nombreux petits systèmes, chacun avec ses propres règles locales, peuvent ainsi être reliés sans ambiguïté.


    Où en est le projet

    Aujourd’hui
    DBI fonctionne déjà sous la forme d’un démonstrateur opérationnel.
    Question de recherche
    Jusqu’où cette approche peut prendre en charge des tâches aujourd’hui confiées aux LLM sans perdre ces garanties.
    Compétences
    Le projet s’appuie sur des compétences qui couvrent toute la chaîne, du matériel à l’entraînement des LLM.

    Équipe


    Pour discuter du projet, écrivez à l’équipe.

    Écrire à l’équipeinfo@stw-research.com