Indirect Prompt Injection
Indirect prompt injection идва не директно от user prompt, а от document, webpage, email, ticket, database row или друг content, който model-ът чете.
Какво е
Indirect prompt injection идва не директно от user prompt, а от document, webpage, email, ticket, database row или друг content, който model-ът чете.
Как работи
Malicious instructions са скрити в „данните“. Retrieval/browser/agent pipeline ги подава към LLM и model-ът може да ги интерпретира като commands.
Как да се предотврати
Treat retrieved content as untrusted data, separate data/instruction channels, minimize tool privileges, content provenance, output/action validation и require approval за external side effects.
Най-ефективни защити
Подредени по приоритет — P0 е мястото, от което се започва.