Model Poisoning / Backdoored Model

Самият model artifact/weights са maliciously modified или съдържат targeted backdoor.

4 обяви в България

Какво е

Самият model artifact/weights са maliciously modified или съдържат targeted backdoor.

Как работи

Model изглежда нормален при стандартни тестове, но реагира неправилно при определен trigger/context. Рискът се увеличава при download на untrusted pre-trained models.

Как да се предотврати

Trusted model registries, checksums/signatures/provenance, isolated evaluation, model scanning, controlled fine-tuning pipeline и independent behavior tests.

Най-ефективни защити

Подредени по приоритет — P0 е мястото, от което се започва.

Всички защити

Други в AI, ML и LLM атаки