Training-Data Poisoning
Data poisoning вкарва malicious/manipulated samples в training или fine-tuning dataset, за да промени model behavior .
Какво е
Data poisoning вкарва malicious/manipulated samples в training или fine-tuning dataset, за да промени model behavior.
Как работи
Poisoned examples могат да намалят accuracy, създадат targeted bias/backdoor или променят behavior при specific trigger.
Как да се предотврати
Dataset provenance, source reputation, anomaly/outlier detection, curation, signed/versioned datasets, independent evaluation и restricted write access до training corpus.
Най-ефективни защити
Подредени по приоритет — P0 е мястото, от което се започва.