Kurz-Fakten
- Ein Sprachmodell unterscheidet nicht zuverlässig zwischen Daten und Anweisungen
- Besonders betroffen sind Agenten, die Dokumente oder Webseiten lesen und danach handeln
- Eine vollständige technische Lösung gibt es bislang nicht
- Wirksam sind Rechtebegrenzung, Bestätigung vor kritischen Aktionen und Protokollierung
Bedeutung in der Praxis
Weil es keine saubere Lösung gibt, verschiebt sich die Frage von der Abwehr zur Schadensbegrenzung. Die belastbare Regel lautet: Ein System, das fremde Inhalte liest, darf keine unumkehrbaren Aktionen ohne menschliche Freigabe ausführen.