Folgenbewusste LLMs
Die erste Forschungslinie trainiert oder programmiert ein LLM so, dass sein Wissen Kausalketten umfasst: die Auswirkungen, die eine Antwort oder eine Handlung auf Menschen haben kann, und auf die reale Welt, wenn das Modell autonom handelt oder Systeme steuert. Vor dem Handeln lernt das Modell, über die möglichen Optionen und ihre Folgen nachzudenken.
- Ein KI-Agent, der mit der Administration eines IT-Systems betraut ist, sollte vorhersehen, dass ein scheinbar harmloser Befehl einen kritischen Dienst stilllegen oder Backups löschen kann.
- Bei der Steuerung eines Industrieroboters sollte er das Risiko für Personen in der Nähe berücksichtigen, auch wenn keine Anweisung es erwähnt.
Es handelt sich nicht um einen Filter auf Basis einer Sperrliste: Das Verhalten ist Teil dessen, was das Modell gelernt hat.
Eine Regel sagt, was zu vermeiden ist; eine Kette von Folgen sagt, warum.
Auch wenn es sicherer ist, bleibt das Modell ein LLM. Was es gelernt hat, lässt sich weiterhin nicht direkt lesen, und seine Sicherheit bleibt eine statistische Messgröße. Hier setzt die zweite Forschungslinie an.