Mit sichtbaren Vorschlägen beginnen
Ein erster Agent kann Informationen sammeln und einen nächsten Schritt vorschlagen, ohne ihn selbst auszuführen. So lässt sich beobachten, ob er das Anliegen richtig versteht und die passenden Daten nutzt. Protokollieren Sie, welche Werkzeuge aufgerufen werden und warum ein Vorgang abgebrochen wird. Dieser kontrollierte Einstieg macht Fehler leichter erkennbar, bevor sie reale Folgeaktionen auslösen.
Rechte außerhalb des Modells durchsetzen
Fremde Dokumente oder Nachrichten können manipulierte Anweisungen enthalten. OWASP beschreibt solche Angriffe als Prompt Injection. Deshalb genügt es nicht, einem Agenten nur im Text zu sagen, was er nicht tun soll. Technische Berechtigungen müssen unerlaubte Zugriffe und Aktionen unabhängig von seiner Antwort begrenzen. Besonders folgenreiche Handlungen benötigen zusätzliche Prüfungen oder eine menschliche Freigabe.
Jede Erweiterung einzeln prüfen
Wenn ein Agent zuverlässig lesen kann, folgt daraus nicht automatisch, dass er auch sicher schreiben darf. Für jede neue Funktion sind Eingaben, Fehlerfolgen und Rücknahmewege zu betrachten. Ein versehentlich doppelt angelegter Vorgang ist ein anderes Problem als eine falsche Bestellfreigabe. Setzen Sie deshalb konkrete Grenzen und testen Sie auch fehlende Daten, Zeitüberschreitungen und wiederholte Ausführung.
Nächster Schritt
Zeichnen Sie für einen geplanten Agenten auf, welche Systeme er lesen und verändern dürfte. Streichen Sie jede Berechtigung, die für die erste abgegrenzte Aufgabe nicht benötigt wird.
Fachliche Einordnung: OWASP: Prompt Injection
