System-Prompt / Hidden-Instruction Leakage

Извличане или реконструкция на internal prompt, policies, hidden context или tool instructions.

Какво е

Извличане или реконструкция на internal prompt, policies, hidden context или tool instructions.

Как работи

Model може да бъде подмамен да цитира/обобщи internal context или sensitive content да попадне в outputs чрез prompt interactions.

Как да се предотврати

Не поставяйте secrets в prompts, enforce secret separation, least data exposure, output filtering за sensitive patterns и assume, че prompt text може да бъде частично inferable.

Най-ефективни защити

Подредени по приоритет — P0 е мястото, от което се започва.

Всички защити

Други в AI, ML и LLM атаки