Direct Prompt Injection

Prompt injection е input, който се опитва да промени instruction hierarchy или intended behavior на LLM/agent.

Какво е

Prompt injection е input, който се опитва да промени instruction hierarchy или intended behavior на LLM/agent.

Как работи

Attacker поставя instructions в user-controlled text, които конфликтуват с application/system instructions. Ако model/application не държи ясни boundaries между data и instructions, поведението може да се отклони.

Как да се предотврати

Не третирайте prompt secrecy като security boundary. Ограничете tools/permissions, валидирайте outputs преди action, isolate untrusted content, използвайте policy enforcement извън model-а и човешко approval за high-impact действия.

Най-ефективни защити

Подредени по приоритет — P0 е мястото, от което се започва.

Всички защити

Източници

Други в AI, ML и LLM атаки