Model Poisoning / Backdoored Model
Самият model artifact/weights са maliciously modified или съдържат targeted backdoor.
Какво е
Самият model artifact/weights са maliciously modified или съдържат targeted backdoor.
Как работи
Model изглежда нормален при стандартни тестове, но реагира неправилно при определен trigger/context. Рискът се увеличава при download на untrusted pre-trained models.
Как да се предотврати
Trusted model registries, checksums/signatures/provenance, isolated evaluation, model scanning, controlled fine-tuning pipeline и independent behavior tests.
Най-ефективни защити
Подредени по приоритет — P0 е мястото, от което се започва.