AI, ML и LLM атаки
Нови атаки срещу самите модели — prompt injection, отравяне на данни, кражба на модел — и AI в услуга на нападателя.
Езиковите модели въведоха клас атаки без аналог в класическата сигурност: инструкция, скрита в данните, която моделът изпълнява, защото не различава съдържание от команда.
Втората половина на групата е обратната посока — AI, използван от нападателя: убедителни фалшификации на глас и видео, автоматизирано разузнаване и мащабно генериране на съдържание за измами.
20 атаки в това семейство
Direct Prompt Injection
Prompt injection е input, който се опитва да промени instruction hierarchy или intended behavior на LLM/agent.
Indirect Prompt Injection
Indirect prompt injection идва не директно от user prompt, а от document, webpage, email, ticket, database row или друг content, който model-ът чете.
Jailbreaking
Jailbreak е input strategy за заобикаляне на model/application policy или behavioral restrictions.
System-Prompt / Hidden-Instruction Leakage
Извличане или реконструкция на internal prompt, policies, hidden context или tool instructions.
Sensitive Information Disclosure by LLM
AI system връща personal, confidential, credential или proprietary data, което не трябва да разкрива .
Training-Data Poisoning
Data poisoning вкарва malicious/manipulated samples в training или fine-tuning dataset, за да промени model behavior .
Model Poisoning / Backdoored Model
Самият model artifact/weights са maliciously modified или съдържат targeted backdoor.
RAG / Vector-Database Poisoning
Manipulation на retrieval corpus, embeddings, metadata или indexing, така че Retrieval-Augmented Generation да получава malicious или misleading context.
Model Extraction / Model Stealing
Model extraction се опитва да възпроизведе proprietary model behavior или decision boundary чрез queries/outputs .
Model Inversion
Model inversion се опитва да възстанови свойства или representative data за training subjects от model outputs/gradients .
Membership Inference
Определяне дали конкретен record/person е бил част от training dataset .
Adversarial Example / Evasion Attack
Evasion attack модифицира input така, че ML model да направи желана за attacker грешка .
Excessive Agency / Tool Abuse
AI agent има повече permissions/actions, отколкото са нужни за задачата .
Insecure Output Handling
Downstream component се доверява на LLM output като на safe code/query/HTML/command .
AI/Model Supply-Chain Compromise
Compromise на model, dataset, tokenizer, plugin, extension, inference image, package или model-hosting source.
Unbounded Consumption / Model DoS
Abuse, който изчерпва AI compute, context/token quota, external tools или financial budget .
Agent Hijacking
Attacker влияе на autonomous/semi-autonomous agent така, че задачата му, memory или tool selection се пренасочва.
Persistent AI Memory/Context Poisoning
Злонамерена информация се записва в long-term memory/profile/context store и влияе на бъдещи sessions.
Retrieval Hijacking / Search Manipulation for AI
Attacker оптимизира web/doc content така, че AI search/retrieval system да избира неговия malicious/biased source.
AI-Assisted Social Engineering
Използване на generative AI за по-бързо, персонализирано или multilingual phishing/vishing/deepfake съдържание.