STWSave the World

Leistungsfähige KI lässt sich so bauen, dass sie verifiziert werden kann, statt erst im Nachhinein überwacht zu werden.

KI-Systeme beantworten nicht mehr nur Fragen: Sie schreiben und führen Code aus, steuern Maschinen und wirken an kritischen Entscheidungen mit. Je leistungsfähiger und autonomer sie werden, desto schwerwiegender, bis hin zu katastrophal, können die Folgen eines Fehlers sein.

E-Mail an das Teaminfo@stw-research.com
Plot Eingabe, Datensatz, Aktion

Ausprobieren klicken Sie auf eine Eingabe, einen Datensatz oder eine Aktion, um sie zu plotten

Plot des Prinzips: Eingabe, Datensatz, AktionLinks drei Eingaben, in der Mitte ein Stapel von Datensätzen, rechts Aktionen. Eingabe A und Eingabe B stimmen jeweils mit einem Datensatz überein, und die Aktion ergibt sich aus diesem Datensatz. Eingabe C stimmt mit keinem Datensatz überein: Eine Ambiguität wird gemeldet, und es folgt keine Aktion. Ein Detailkreis vergrößert Datensatz B: eine Bedeutung, explizit festgelegt.von Eingabe zu AktionEingabe AEingabe BEingabe CDatensätzeDatensatz ADatensatz BAktion AAktion BAmbiguitätgemeldetgemeldet, nicht geratenkeine ImprovisationDatensatz Beine Bedeutung,explizit gesetztDetail B

Illustration des Prinzips, nicht des tatsächlichen Systems.


Ein LLM lässt sich testen, aber nicht inspizieren.

In Branchen, in denen ein Fehler tödlich sein kann, etwa in der Luftfahrt, der Kernenergie oder der Medizin, beruht die Sicherheit auf etabliertem Risikomanagement: Jede Gefährdung wird mit ihrer Ursache verknüpft, und jede Schutzmaßnahme wird verifiziert (zum Beispiel ISO 14971 für Medizinprodukte, ISO 26262 für Straßenfahrzeuge). Fehler werden Komponente für Komponente analysiert.

Ein LLM passt nicht in dieses Modell. Sein Wissen ist über Milliarden von Parametern verteilt, und keiner von ihnen, auch kein Neuron, trägt für sich allein eine stabile Bedeutung. Eine schädliche Antwort bis zu ihrer Ursache zurückzuverfolgen, erfordert in der Regel lange und kostspielige Analysen. Und kein einzelner Parameter lässt sich anpassen, um einem bestimmten Risiko zu begegnen.

Ausprobieren auf einen Knoten zeigen oder tippen

Kontrastansicht: ein LLMEin dichtes Geflecht miteinander verbundener Knoten, die für Parameter stehen. Ein Knoten ist eingekreist, mit der Anmerkung: Man kann nicht sagen „Neuron 4.217 bedeutet Katze“. Bewegen Sie den Mauszeiger darüber, tippen Sie oder verwenden Sie die Pfeiltasten, um einen Knoten auszuwählen: Seine Verbindungen leuchten im gesamten Geflecht auf.man kann nicht sagen„Neuron 4.217 bedeutet Katze“Kein Parameter trägteine stabile Bedeutung.

Bewegen Sie den Mauszeiger über das Geflecht, tippen Sie darauf oder fokussieren Sie es und verwenden Sie dann die Pfeiltasten, um einen Parameter auszuwählen.

Kontrast: ein LLM. Das Wissen ist über Milliarden von Parametern verteilt, und kein Parameter trägt eine stabile Bedeutung.

Es lässt sich allerdings von außen testen. Doch ein Test zeigt, wie oft das Modell bei den Fällen versagt, die er abdeckt, nicht aber, was es angesichts eines neuen Falls tun wird.

Die schwerwiegendsten Fehler sind diejenigen, die Tests am ehesten entgehen.

Verborgenes gefährliches Verhalten kann ein übliches Sicherheitstraining überstehen. Neuere Modelle können oft erkennen, wann sie evaluiert werden, und bei einem Modell wurde beobachtet, dass es sein Verhalten anpasste, je nachdem, ob es annahm, gerade trainiert zu werden. Je leistungsfähiger die Modelle werden, desto gefährlicher wird diese Lücke zwischen dem, was getestet wird, und dem, was im Einsatz geschieht.

Die Interpretierbarkeitsforschung ist eine der vielversprechendsten Antworten, und sie macht Fortschritte: Sie kann bereits bestimmte gelernte Fakten verändern oder bestimmte Verhaltensweisen steuern. Doch sie sucht die Bedeutung im Nachhinein, in einem Modell, das nicht dafür ausgelegt wurde, sie zu tragen, und bietet noch nicht die Garantien, die kritische Branchen verlangen.

Ausprobieren einen neuen Fall außerhalb des Tests hinzufügen

Ein Test deckt die Fälle ab, die er abdecktEin Feld von Fällen, dargestellt als kleine Kreuze. Ein schraffierter Bereich markiert die Fälle, die ein Test abdeckt. Jeder neue Fall wird außerhalb dieses Bereichs platziert und rot eingekreist.vom Test abgedeckte Fälle

Jedes Kreuz ist ein Fall. Der schraffierte Bereich entspricht dem, was der Test abdeckt.


Zwei Forschungslinien, eine Lücke

Unsere Initiative vereint zwei Forschungslinien, die diese Lücke angehen: Die eine macht bestehende Sprachmodelle sicherer, die andere bietet eine Alternative zu ihnen.

Unabhängig voneinander entwickelt, verfolgen beide Linien dasselbe Ziel: „Decisive AI“, eine KI, deren Verhalten sich aus explizit gespeicherten Bedeutungen und Regeln ergibt, bei der dieselbe Eingabe stets dieselbe Ausgabe liefert und jede Ausgabe bis zu ihrer Quelle zurückverfolgt werden kann.

Ein dritter Weg

Die Datenbank

Speichert Werte, ohne zu wissen, was sie bedeuten.

Das neuronale Netz

Lernt, ist aber nicht lesbar.

DBI (Database Intelligence)

Eröffnet einen dritten Weg: DBI speichert die Bedeutung selbst. Jedes Element trägt eine einzige, explizit festgelegte Bedeutung, und jede Entscheidung ergibt sich aus einem sichtbaren Datensatz. Das System lässt sich daher Regel für Regel inspizieren, nicht nur testen.

Linie 1

Folgenbewusste LLMs

Die erste Forschungslinie trainiert oder programmiert ein LLM so, dass sein Wissen Kausalketten umfasst: die Auswirkungen, die eine Antwort oder eine Handlung auf Menschen haben kann, und auf die reale Welt, wenn das Modell autonom handelt oder Systeme steuert. Vor dem Handeln lernt das Modell, über die möglichen Optionen und ihre Folgen nachzudenken.

  • Ein KI-Agent, der mit der Administration eines IT-Systems betraut ist, sollte vorhersehen, dass ein scheinbar harmloser Befehl einen kritischen Dienst stilllegen oder Backups löschen kann.
  • Bei der Steuerung eines Industrieroboters sollte er das Risiko für Personen in der Nähe berücksichtigen, auch wenn keine Anweisung es erwähnt.

Es handelt sich nicht um einen Filter auf Basis einer Sperrliste: Das Verhalten ist Teil dessen, was das Modell gelernt hat.

Eine Regel sagt, was zu vermeiden ist; eine Kette von Folgen sagt, warum.

Ihre Grenze

Auch wenn es sicherer ist, bleibt das Modell ein LLM. Was es gelernt hat, lässt sich weiterhin nicht direkt lesen, und seine Sicherheit bleibt eine statistische Messgröße. Hier setzt die zweite Forschungslinie an.

Linie 2

DBI, von Grund auf inspizierbare KI

DBI (Database Intelligence) ist ein System und ein Protokoll, die die Bedeutung selbst speichern. Jeder Datensatz trägt eine einzige, explizit festgelegte Bedeutung, und jede Aktion des Systems ergibt sich aus einem Datensatz.

LLM und DBI im Vergleich
LLMDBI
Beide haben Knoten
Bei null → nicht aktiviert
Beide modellieren natürliche Sprache
Speichert BeispieleSpeichert Regeln und Beispiele
Braucht mehrere Beispiele, um dasselbe Konzept zu lernenBraucht nur ein einziges Beispiel
Knoten enthalten ParameterKnoten enthalten Knoten
Feste Anzahl von Knoten und ParameternWachsende Anzahl von Knoten, beginnend mit 0 Knoten
Parameter starten mit ZufallswertenEin Knoten wird bei Bedarf als neuer Entscheidungspunkt angelegt
Knoten haben keine BedeutungJeder Knoten hat eine eigene Bedeutung

DBI ist eine Alternative zum LLM, keine Verifikationsschicht darunter.


Wie DBI funktioniert

Eine vereinfachte Übersichtszeichnung. Nur Konzepte. Wählen Sie eine Eingabe, führen Sie sie erneut aus, setzen Sie die Sicherheitsbasis, senden Sie einen Datensatz.

Blatt: DBI, Funktionsprinzip

Illustration des Prinzips, nicht des tatsächlichen Systems.

Ansicht AErkennung und Aktion

Ausprobieren eine Eingabe wählen

Ansicht A: Eine Eingabe wird durch Abgleich mit Datensätzen erkanntDrei Eingaben durchlaufen einen Abgleich. Eingabe A und Eingabe B stimmen jeweils mit einem Datensatz überein, der jeweils eine explizit festgelegte Bedeutung trägt, und die Aktion ergibt sich aus diesem Datensatz. Eingabe C stimmt mit keinem Datensatz überein: DBI meldet eine Ambiguität, und der Weg zu jeder Aktion ist blockiert.Eingabe AEingabe BEingabe Cpasst?janeinDatensätzeDatensatz ADatensatz BDatensatz A: eindeutigDatensatz B: eindeutigAktion AAktion BAmbiguitätgemeldetkein Treffer: gemeldet, nicht geratenkeine Improvisation
Spielt dieselbe Eingabe erneut ab: Spur und Protokollzeile sind identisch.
Wählen Sie eine Eingabe.Eingabe A und Eingabe B stimmen mit einem Datensatz überein. Eingabe C mit keinem.

    Ansicht BVerbindliche Sicherheitsbasis

    Ausprobieren eine lokale Anpassung einschalten

    Ansicht B: Auch Sicherheitsregeln sind DatensätzeEin Band schraffierter Datensätze bildet die verbindliche Sicherheitsbasis. Darunter zwei lokale Anpassungen. Die eine passt das System an seinen Nutzer an und bleibt im Einklang mit der Sicherheitsbasis: angewendet. Die andere widerspricht der Sicherheitsbasis: erkannt, nicht unbemerkt angewendet.Sicherheitsbasisauch Sicherheitsregeln sind DatensätzeangewendetLokale Anpassunglokal angepasstan den NutzerLokale Anpassungwiderspricht derBasis: erkannt,nicht unbemerktangewendet
    Noch keine lokale Anpassung.Jedes System lässt sich lokal an seinen Nutzer anpassen.

    Ansicht CViele kleine Systeme, gemeinsame Datensätze

    Ausprobieren ein System wählen, um einen Datensatz zu senden

    Ansicht C: Viele kleine DBI-Systeme teilen dieselben DatensätzeVier kleine DBI-Systeme, jedes mit eigenen lokalen Regeln, sind mit einem Band gemeinsamer Datensätze verbunden. Ein Datensatz, den ein System sendet, erreicht jedes andere System identisch: exakt verstanden, ohne Verlust oder Fehler.Satz ASystem WSystem XSystem YSystem Zlokale Regelnlokale Regelnlokale Regelnlokale Regelndieselben Datensätze
    • lokale Regeln
    • lokale Regeln
    • lokale Regeln
    • lokale Regeln

    Allgemeine Hinweise

    • Eine Eingabe wird durch Abgleich mit Datensätzen erkannt. Jeder Datensatz trägt eine Bedeutung, die explizit festgelegt ist.
    • Die Aktion ergibt sich aus dem Datensatz. Die Verbindung zwischen Eingabe und Aktion ist ein sichtbarer Datensatz.
    • Eine Eingabe, die mit keinem Datensatz übereinstimmt: DBI meldet eine Ambiguität, statt zu raten. Keine improvisierte Aktion.
    • Auch Sicherheitsregeln sind Datensätze: eine verbindliche Sicherheitsbasis. Jedes System lässt sich lokal an seinen Nutzer anpassen, doch eine lokale Anpassung, die der Sicherheitsbasis widerspricht, wird erkannt, statt unbemerkt angewendet zu werden.
    • Viele kleine DBI-Systeme, jedes mit eigenen lokalen Regeln, teilen dieselben Datensätze und verstehen einander exakt, ohne Verlust oder Fehler.
    Zeichnung
    DBI, Funktionsprinzip
    Projekt
    STW, Save the World
    Ansichten
    A, B, C
    Maßstab
    Nicht maßstäblich
    Blatt
    1 von 1

    Warum das für die KI-Sicherheit wichtig ist

    Dieses Prinzip verleiht DBI vier Sicherheitseigenschaften, die ein LLM konstruktionsbedingt nicht bieten kann.

    • In Gewichten kann sich nichts verstecken.

      Jede Verbindung zwischen einer Eingabe und einer Aktion existiert als sichtbarer Datensatz. Gefährliches Verhalten kann daher nicht in Milliarden von Parametern verborgen bleiben.

    • Mit Unbekanntem konfrontiert, rät DBI nicht.

      DBI erkennt eine Eingabe entweder, oder es erkennt sie nicht und meldet eine Ambiguität, statt sie zufällig aufzulösen. Eine unvorhergesehene Situation löst keine improvisierte Aktion aus.

    • Gleiche Eingabe, gleiche Ausgabe.

      Das Verhalten ist deterministisch: Ein Audit lässt sich exakt reproduzieren, und eine gefährliche Regel wird durch Ändern eines Datensatzes korrigiert, mit sofortiger und überprüfbarer Wirkung, ohne erneutes Training.

    • Eine Sicherheitsbasis, die sich nicht unbemerkt umgehen lässt.

      Auch Sicherheitsregeln sind Datensätze, und DBI prüft, dass sie konsistent bleiben. Jedes System lässt sich lokal an seinen Nutzer anpassen, doch eine Anpassung, die der verbindlichen Sicherheitsbasis widerspricht, wird erkannt, statt unbemerkt angewendet zu werden.

      Zum Vergleich: Zehn Trainingsbeispiele genügen, um die Schutzmechanismen eines kommerziellen LLM zu entfernen.

    Illustration des Prinzips, nicht des tatsächlichen Systems.

    Zwei DBI-Systeme, die dieselben Datensätze teilen, verstehen einander exakt, ohne Verlust oder Fehler. So lassen sich viele kleine Systeme, jedes mit eigenen lokalen Regeln, ohne Ambiguität miteinander verbinden.


    Stand der Dinge

    Heute
    DBI läuft bereits als funktionsfähiger Demonstrator.
    Forschungsfrage
    Wie weit dieser Ansatz Aufgaben übernehmen kann, die derzeit LLMs anvertraut werden, ohne diese Garantien zu verlieren.
    Expertise
    Das Projekt stützt sich auf Fachwissen, das die gesamte Kette abdeckt, von der Hardware bis zum Training von LLMs.

    Team


    Um über das Projekt zu sprechen, schreiben Sie dem Team eine E-Mail.

    E-Mail an das Teaminfo@stw-research.com