Training-Data Poisoning

Data poisoning вкарва malicious/manipulated samples в training или fine-tuning dataset, за да промени model behavior .

Какво е

Data poisoning вкарва malicious/manipulated samples в training или fine-tuning dataset, за да промени model behavior.

Как работи

Poisoned examples могат да намалят accuracy, създадат targeted bias/backdoor или променят behavior при specific trigger.

Как да се предотврати

Dataset provenance, source reputation, anomaly/outlier detection, curation, signed/versioned datasets, independent evaluation и restricted write access до training corpus.

Най-ефективни защити

Подредени по приоритет — P0 е мястото, от което се започва.

Всички защити

Източници

Други в AI, ML и LLM атаки