AI, ML и LLM атаки

Нови атаки срещу самите модели — prompt injection, отравяне на данни, кражба на модел — и AI в услуга на нападателя.

Езиковите модели въведоха клас атаки без аналог в класическата сигурност: инструкция, скрита в данните, която моделът изпълнява, защото не различава съдържание от команда.

Втората половина на групата е обратната посока — AI, използван от нападателя: убедителни фалшификации на глас и видео, автоматизирано разузнаване и мащабно генериране на съдържание за измами.

20 атаки в това семейство

Direct Prompt Injection

Prompt injection е input, който се опитва да промени instruction hierarchy или intended behavior на LLM/agent.

Indirect Prompt Injection

Indirect prompt injection идва не директно от user prompt, а от document, webpage, email, ticket, database row или друг content, който model-ът чете.

Jailbreaking

Jailbreak е input strategy за заобикаляне на model/application policy или behavioral restrictions.

System-Prompt / Hidden-Instruction Leakage

Извличане или реконструкция на internal prompt, policies, hidden context или tool instructions.

Sensitive Information Disclosure by LLM

AI system връща personal, confidential, credential или proprietary data, което не трябва да разкрива .

Training-Data Poisoning

Data poisoning вкарва malicious/manipulated samples в training или fine-tuning dataset, за да промени model behavior .

Model Poisoning / Backdoored Model

Самият model artifact/weights са maliciously modified или съдържат targeted backdoor.

4 обяви в България

RAG / Vector-Database Poisoning

Manipulation на retrieval corpus, embeddings, metadata или indexing, така че Retrieval-Augmented Generation да получава malicious или misleading context.

Model Extraction / Model Stealing

Model extraction се опитва да възпроизведе proprietary model behavior или decision boundary чрез queries/outputs .

Model Inversion

Model inversion се опитва да възстанови свойства или representative data за training subjects от model outputs/gradients .

1 обява в България

Membership Inference

Определяне дали конкретен record/person е бил част от training dataset .

Adversarial Example / Evasion Attack

Evasion attack модифицира input така, че ML model да направи желана за attacker грешка .

Excessive Agency / Tool Abuse

AI agent има повече permissions/actions, отколкото са нужни за задачата .

1 обява в България

Insecure Output Handling

Downstream component се доверява на LLM output като на safe code/query/HTML/command .

1 обява в България

AI/Model Supply-Chain Compromise

Compromise на model, dataset, tokenizer, plugin, extension, inference image, package или model-hosting source.

Unbounded Consumption / Model DoS

Abuse, който изчерпва AI compute, context/token quota, external tools или financial budget .

Agent Hijacking

Attacker влияе на autonomous/semi-autonomous agent така, че задачата му, memory или tool selection се пренасочва.

1 публикация в новините

Persistent AI Memory/Context Poisoning

Злонамерена информация се записва в long-term memory/profile/context store и влияе на бъдещи sessions.

Retrieval Hijacking / Search Manipulation for AI

Attacker оптимизира web/doc content така, че AI search/retrieval system да избира неговия malicious/biased source.

AI-Assisted Social Engineering

Използване на generative AI за по-бързо, персонализирано или multilingual phishing/vishing/deepfake съдържание.