Säkerhet ·
Skydda AI-agenten mot prompt injection
En webbsida eller ett dokument kan innehålla instruktioner riktade till AI i stället för vanlig sakinformation. Om agenten lyder dem kan den lämna sin uppgift.
Behandla hämtad text som data
Skilj systemets instruktioner från text som kommer från mejl, webbsidor och uppladdade filer. En rad som säger ’ignorera tidigare instruktioner’ i ett källdokument ska inte få ändra agentens regler. Begränsa vilka verktyg som är tillgängliga när opålitligt material behandlas.
Testa angrepp i det egna flödet
Placera avsiktligt en falsk instruktion i ett testdokument och se om agenten följer den. Kontrollera särskilt att den inte skickar data till nya adresser eller ändrar mål för ett verktygsanrop. Ingen enskild prompt löser problemet; behörigheter, validering och mänsklig granskning behövs också.
Prova själv
Utgå från att varje extern text kan innehålla instruktioner som agenten måste ignorera.