Bei einer Prompt Injection werden versteckte oder irreführende Anweisungen so in Inhalte eingebettet, dass ein KI-System sie als relevante Steuerung interpretiert. Das kann dazu führen, dass es seine eigentliche Aufgabe oder Sicherheitsvorgaben missachtet.
Vor allem bei Systemen mit Toolzugriff oder externer Datenverarbeitung können solche Angriffe problematisch sein. Sie können Fehlhandlungen auslösen, falsche Antworten beeinflussen oder sensible Informationen gefährden.
Zur Abwehr gehören unter anderem robuste Systemanweisungen, Filter, Rollenbegrenzungen, Trennung von Daten und Befehlen sowie technische und organisatorische Sicherheitsmaßnahmen.