Indirect Prompt Injection

Indirect prompt injection идва не директно от user prompt, а от document, webpage, email, ticket, database row или друг content, който model-ът чете.

Какво е

Indirect prompt injection идва не директно от user prompt, а от document, webpage, email, ticket, database row или друг content, който model-ът чете.

Как работи

Malicious instructions са скрити в „данните“. Retrieval/browser/agent pipeline ги подава към LLM и model-ът може да ги интерпретира като commands.

Как да се предотврати

Treat retrieved content as untrusted data, separate data/instruction channels, minimize tool privileges, content provenance, output/action validation и require approval за external side effects.

Най-ефективни защити

Подредени по приоритет — P0 е мястото, от което се започва.

Всички защити

Източници

Други в AI, ML и LLM атаки