Sicherheit von KI und Agenten
Verstehe Modelle, abgerufenen Kontext, Werkzeuge, Identität und Befugnisse vor Prompt Injection.
Verstehe Modelle, abgerufenen Kontext, Werkzeuge, Identität und Befugnisse vor Prompt Injection.
- Sicherheitsgrundlagen
- Identität und Zugriff
Auf dieser Seite
Beginne mit dem System, nicht mit dem Chatfenster
Ein großes Sprachmodell sagt Tokens aus einem Kontext voraus. Die Anwendung entscheidet, welche Anweisungen, Gespräche, abgerufenen Dokumente und Werkzeugergebnisse in diesen Kontext gelangen. Ein Agent ergänzt eine Schleife, die Handlungen auswählt, Werkzeuge aufruft und das Ergebnis für die nächste Entscheidung nutzt.
Das Modell ist nur eine Komponente. Sicherheit hängt von den Grenzen zwischen Daten, Anweisungen, Identität und Befugnissen ab.
- Anfrage und abgerufene Daten gelangen in den Kontext.
- Das Modell schlägt eine Handlung vor.
- Richtlinie und Identität entscheiden über die Freigabe.
- Das Werkzeug handelt in einem begrenzten externen System.
- Das Ergebnis wird zum Datum der nächsten Entscheidung.
Grundbegriffe
- Tokens und Kontextfenster: die endliche Folge, die das Modell bei einer Inferenz berücksichtigen kann.
- RAG: Retrieval fügt ausgewähltes externes Material vor der Generierung hinzu.
- Embeddings und Vektordatenbanken: numerische Darstellungen und Speicher zur Ähnlichkeitssuche; Ähnlichkeit ist weder Autorität noch Wahrheit.
- System- und Nutzeranweisungen: Vorgaben der Anwendung und der nutzenden Person. Die beabsichtigte Priorität macht externe Inhalte nicht harmlos.
- MCP: ein Protokoll, über das Clients Werkzeuge und Ressourcen eines Servers entdecken; Authentifizierung und Autorisierung bleiben Aufgabe der Bereitstellung.
Zentrale Fehlerklassen
Prompt Injection versucht, das beabsichtigte Verhalten über Eingaben zu verändern. Indirekte Prompt Injection steckt in externen Daten. Weitere Risiken sind Datenoffenlegung, vergiftete Daten oder Modelle, unsichere Verarbeitung der Ausgabe und übermäßige Agency: zu viele Funktionen, Rechte oder autonome Schritte.
Nächster SchrittKI nach ihren Voraussetzungen einordnenSieh, wie Betriebssysteme, Netzwerke, Sicherheit und Identität in Agentensicherheit einfließen.