System-Prompt / Hidden-Instruction Leakage
Извличане или реконструкция на internal prompt, policies, hidden context или tool instructions.
Какво е
Извличане или реконструкция на internal prompt, policies, hidden context или tool instructions.
Как работи
Model може да бъде подмамен да цитира/обобщи internal context или sensitive content да попадне в outputs чрез prompt interactions.
Как да се предотврати
Не поставяйте secrets в prompts, enforce secret separation, least data exposure, output filtering за sensitive patterns и assume, че prompt text може да бъде частично inferable.
Най-ефективни защити
Подредени по приоритет — P0 е мястото, от което се започва.