Des LLM conscients des conséquences
Le premier axe de recherche entraîne ou programme un LLM pour que son savoir inclue des chaînes causales : les effets qu’une réponse ou une action peut avoir sur les personnes, et sur le monde réel quand le modèle agit de façon autonome ou commande des systèmes. Avant d’agir, le modèle apprend à réfléchir aux options possibles et à leurs conséquences.
- Un agent d’IA chargé d’administrer un système informatique doit anticiper qu’une commande en apparence anodine peut couper un service critique ou effacer des sauvegardes.
- Aux commandes d’un robot industriel, il doit tenir compte du risque pour les personnes à proximité, même si aucune consigne ne le mentionne.
Ce n’est pas un filtre fondé sur une liste noire : ce comportement fait partie de ce que le modèle a appris.
Une règle dit ce qu’il faut éviter ; une chaîne de conséquences dit pourquoi.
Même plus sûr, le modèle reste un LLM. Ce qu’il a appris ne se lit toujours pas directement, et sa sécurité reste une mesure statistique. C’est ce que traite le second axe de recherche.