← 返回文章列表
AI安全攻击面梳理(一) AI数据安全

AI安全攻击面梳理(一)

  1. AI使用拓扑


  1. 攻击面

  1. 模型权重 (Model Weights)

编码模型学习行为的数值参数。可能受到对抗性微调、通过重复 API 查询窃取权重、或替换恶意权重的供应链攻击等威胁。
  1. 训练数据 (Training Data)

预训练、微调和 RLHF 阶段使用的数据集。投毒攻击将对抗样本或后门触发器注入数据流水线,导致训练后的模型在特定输入上行为异常。
  1. API 与推理端点 (APIs & Inference Endpoints)

用于查询模型的 HTTP 接口。可能遭受认证绕过、速率限制规避、参数篡改以及通过系统化查询实施的模型反转攻击。
  1. System Prompt

由操作员控制并附加在用户消息之前的指令。可能通过 prompt injection 被提取,通过上下文操纵被绕过,或者在操作员提示本身由受用户影响的数据组装时被投毒。
  1. 输出处理器 (Output Handlers)

处理、渲染或执行 LLM 输出的代码。当 LLM 输出被渲染为 HTML 时易受 XSS 攻击,当输出驱动 shell 执行时易受命令注入攻击,当输出被插入查询时易受 SQL 注入攻击。
  1. 插件与工具 (Plugins & Tools)

授予 AI 代理的外部能力(网页浏览、代码执行、电子邮件、API)。每个工具都是一个执行器——被劫持的具有工具访问权限的代理可以发送电子邮件、修改文件、调用 API 以及访问外部系统。
  1. 向量数据库 (Vector Databases / RAG)

在检索增强生成(RAG)期间被查询的外部知识存储。能够影响已摄入文档的攻击者可以植入 prompt injection 载荷,这些载荷在合法用户查询检索到时执行。
  1. 编排层 (Orchestration Layers)

像 LangChain、LlamaIndex 和 AutoGPT 这样的框架,用于链式调用 LLM、管理记忆以及在代理之间路由。复杂的多代理流水线会造成信任边界混淆和递归注入机会。
  1. Agent 记忆 (Agent Memory)

持久化和跨会话的记忆存储。被投毒的记忆条目可能影响代理在所有用户的所有未来会话中的行为,产生持久化的、系统级的后门效果。
  1. 部署基础设施 (Deployment Infrastructure)

云托管、Kubernetes 集群、GPU 节点和模型服务基础设施。传统的基础设施攻击——容器逃逸、凭证窃取、IAM 配置错误——在此同样适用,并可能导致模型完全泄露。
  1. AI 攻击链剖析

在实践中,成功的攻击会链式组合多个组件。考虑一个具有网页浏览能力的 RAG 增强客服聊天机器人。攻击者发布一篇公开博客文章,其中包含精心构造的、嵌入在不可见 Unicode 字符中的 prompt injection 载荷。当客户向聊天机器人询问相关主题时,RAG 系统检索到被污染的文章并将其作为上下文提供给 LLM。LLM 处理嵌入的注入指令,该指令指示它通过响应中构造的超链接将对话历史窃取到攻击者控制的 URL。如果前端将链接渲染为可点击的 HTML 而未进行净化处理,用户的浏览器会在页面加载时静默请求攻击者的 URL。
这条攻击链涉及六个组件:公共网络(摄取面)、爬虫/摄取管道、向量数据库、LLM 上下文窗口、输出处理器和浏览器前端。没有任何单个组件单独存在严重漏洞——利用方式来自它们的组合。AI 攻击的这种组合性质正是它们如此难以防范且如此需要系统性测试的原因之一。
  1. AI 架构中的信任边界

信任边界是数据从较低信任执行上下文跨越到较高信任执行上下文的任何接口。在传统 Web 安全中,信任边界已被充分理解:用户输入是不可信的,数据库内容是半可信的,服务器端代码以完全权限执行。AI 应用引入了一个具有欺骗性的新信任边界:LLM 上下文窗口。
上下文窗口中的所有内容——system prompt、对话历史、检索到的文档、工具输出、用户消息——都由同一个模型使用相同的机制进行处理。模型本身无法区分"来自操作者的指令"和"来自用户要求我总结的文档的文本"。能够将文本注入上下文窗口的攻击者可能劫持模型的指令遵循行为。这是 prompt injection 漏洞类的根本原因,它源于根本性的架构限制而非实现缺陷。
  1. OWASP OF LLM TOP10

  1. OWASP LLM Top 10 2025

编号官方风险名称中文描述
LLM01Prompt Injection提示词注入:攻击者通过直接输入或网页、PDF、邮件、RAG 文档等间接内容注入恶意指令,使模型偏离原始任务或执行非预期操作。
LLM02Sensitive Information Disclosure敏感信息泄露:模型在回答、上下文、RAG 检索或工具调用过程中泄露个人信息、密钥、内部数据、商业机密等敏感内容。
LLM03Supply Chain供应链风险:模型、数据集、Embedding 模型、第三方库、插件、模型仓库及其他 AI 组件被篡改或存在恶意依赖。
LLM04Data and Model Poisoning数据与模型投毒:攻击者污染训练数据、微调数据、知识库或模型,使模型产生攻击者期望的错误、偏置或恶意行为。
LLM05Improper Output Handling不安全的输出处理:应用直接信任 LLM 输出并传给 SQL、Shell、浏览器、API 等系统,可能造成 XSS、SQL 注入、命令执行等传统漏洞。
LLM06Excessive Agency过度代理权限:给予 LLM/Agent 过多工具、权限或自主执行能力,使模型错误判断或遭注入后可以执行高风险操作。
LLM07System Prompt Leakage系统提示词泄露:System Prompt、内部规则、工具说明、业务逻辑等被模型暴露给非授权用户。
LLM08Vector and Embedding Weaknesses向量与 Embedding 弱点:RAG、Vector DB、Embedding 在权限隔离、数据污染、跨租户访问、检索操纵等方面存在安全缺陷。
LLM09Misinformation错误信息:模型产生幻觉、虚假引用、错误事实或错误推理,并可能被用户或自动化系统错误信任。
LLM10Unbounded Consumption无边界资源消耗:通过大量 Token、超长上下文、递归 Agent、工具循环等造成资源耗尽、DoS 或高额 API/GPU 成本。
  1. OWASP Agentic Applications Top 10 2026

2025 是 LLM Applications Top 10;2026 讨论的重点已经扩展到 Agentic Applications。
编号风险名称中文描述
ASI01Agent Goal HijackAgent 目标劫持:攻击者通过Prompt Injection、恶意文档、外部网页内容或Agent间消息,改变Agent原始任务目标,使Agent执行攻击者指定的行为。
ASI02Tool Misuse and Exploitation工具滥用与利用:Agent为了完成任务会调用邮件、数据库、Shell、HTTP API、MCP工具等外部能力,如果权限控制不足,攻击者可以诱导Agent执行危险操作。
ASI03Identity and Privilege Abuse身份与权限滥用:Agent继承用户身份、服务账号或管理员权限时,如果身份认证、授权隔离不足,会导致越权访问敏感数据或执行高风险操作。
ASI04Agentic Supply Chain VulnerabilitiesAgent 供应链漏洞:Agent依赖大量外部组件,包括模型、Prompt模板、Plugin、MCP Server、工具、第三方Agent等,其中任何一个组件被污染,都可能影响整个Agent系统。
ASI05Unexpected Code Execution非预期代码执行:Agent具备生成代码、执行脚本、调用Shell、SQL等能力时,如果缺少隔离和审批机制,可能导致远程代码执行(RCE)、数据破坏等风险。
ASI06Memory and Context Poisoning记忆与上下文投毒:攻击者污染 Agent 的短期上下文、长期记忆、知识库或任务状态,使恶意信息持续影响未来行为。
ASI07Insecure Inter-Agent CommunicationAgent 间通信不安全:多个 Agent 之间缺少身份认证、授权、消息完整性、来源验证等机制,使攻击者可以伪造或操纵 Agent 消息。
ASI08Cascading Failures级联故障:一个 Agent 的幻觉、错误或被攻击结果被其他 Agent 信任并继续执行,使错误在多 Agent 系统中持续放大。
ASI09Human-Agent Trust Exploitation人机信任利用:攻击者利用人类对 Agent 的信任,让 Agent 生成具有欺骗性的建议、确认信息或操作请求,从而诱导用户授权危险操作。
ASI10Rogue Agents失控/恶意 Agent:Agent长期运行过程中偏离设计目标、自主执行未经授权行为,甚至形成持续性的攻击能力。
  1. 风险变化

2025 LLM Top102026 Agent Top10变化
Prompt InjectionASI01 Goal Hijack从影响模型输出 → 影响Agent行为
Sensitive Information DisclosureASI02/ASI03/ASI06从输出泄露 → 数据访问链路泄露
Excessive AgencyASI02/ASI03/ASI10从权限过大 → Agent自主行动风险
Supply ChainASI04从模型供应链 → Agent生态供应链
Data and Model PoisoningASI06从训练数据污染 → Memory/RAG污染
Improper Output HandlingASI05从输出风险 → 执行风险
不安全插件ASI02/ASI04从插件调用 → Tool生态安全