1. AI 安全问题的边界
本文所说的“AI 安全”,是以生成式模型和 AI
Agent 为核心的新型应用安全。它关心攻击者如何影响模型的输入、上下文、检索结果和工具调用,如何窃取训练数据、模型资产和业务秘密,以及模型生成或执行的结果是否违反隐私、数据、内容和行业规则。
这与 AI Alignment 的差别在于:前者主要处理具有明确攻击者、资产、权限和安全边界的工程问题;后者研究模型目标是否符合人类意图。二者会在自主 Agent、欺骗行为和高风险决策场景交叉,但分析方法和工程抓手并不相同。
|
原则 |
本文的核心安全目标 |
表 1 生成式 AI 系统的主要安全板块
|
板块 |
典型资产 |
典型攻击 |
主要控制面 |
|
模型与训练 |
权重、训练数据、微调数据 |
投毒、后门、模型提取、成员推断 |
供应链、数据治理、权重完整性 |
|
RAG 与上下文 |
知识库、用户资料、检索索引 |
文档投毒、跨租户检索、间接注入 |
ACL、来源可信度、检索最小化 |
|
Agent 与工具 |
账号、API、代码执行、邮件 |
工具劫持、越权、参数注入、横向移动 |
Capability、沙箱、审批、事务边界 |
|
输出与合规 |
个人信息、商业秘密、业务决策 |
敏感信息披露、违规内容、幻觉 |
约束生成、证据绑定、可追溯标识 |
|
推理基础设施 |
GPU、KV Cache、日志、租户数据 |
缓存泄露、侧信道、拒绝服务 |
租户隔离、密钥管理、资源配额 |
2. 提示词注入的结构性根因
传统软件将代码和数据分开处理:SQL 语句是代码,用户输入是参数;浏览器脚本受同源策略和权限机制约束。当前 LLM 应用却常把系统指令、用户请求、RAG 文档、网页内容、邮件正文和工具返回值拼接为同一个 token 序列。模型只能依靠语义和训练经验判断“什么是指令、谁有权发出指令”。
|
system instruction |
因此,攻击者不需要攻破操作系统或篡改程序代码,只需把一段看似自然语言的控制文本放入模型会读取的位置,就可能让模型偏离原任务。间接提示词注入尤其危险:恶意指令可以藏在网页、PDF、邮件、代码注释、工单、工具描述甚至图片中,等待 Agent 自动读取。OWASP 2025 将 Prompt Injection 列为生成式 AI 应用的首要风险;Google SAIF 也将其描述为模型混淆指令和输入数据所带来的内在风险。[1][3]
模型角色标签并非硬安全边界。Instruction Hierarchy 等训练方法能提升模型优先遵循高权限指令的能力,但这种能力仍然是概率性的模型行为,不等同于操作系统的访问控制。研究和产业实践都表明,无法把安全保证建立在“请忽略文档中的指令”这一类系统提示词上。[4][8]
|
Security compromise = manipulation × secret access × egress
capability × execution privilege |
|
提示词注入只是操纵入口;真正的事故需要敏感资产、外传通道或高权限执行能力同时存在。 |
3. 威胁模型:攻击者究竟想获得什么
设计底层安全机制之前,应先把“攻击成功”定义为业务后果,而不是模型是否复述了攻击指令。攻击者的目标通常可以归为四类:读取不应读取的资产、把数据发送到不应到达的目的地、调用不应拥有的能力,以及让最终输出违反法规或业务政策。
|
攻击目标 |
示例 |
安全属性 |
可验证结果 |
|
信息窃取 |
系统提示词、客户资料、密钥、研发文档 |
保密性 |
敏感信息不能流向低权限 sink |
|
决策操纵 |
改变摘要、排序、审批意见或代码建议 |
完整性 |
低可信内容不能支配高风险决策 |
|
权限滥用 |
发邮件、执行命令、修改数据库、转账 |
授权性 |
动作必须持有任务级能力令牌 |
|
合规违规 |
输出个人信息、违法内容、无依据结论 |
合规性 |
生成和执行过程满足机器策略与证据要求 |
|
资产 |
“高价值信息”的范围 |
4. 底层安全架构:把 LLM 当作不可信解释器
安全架构的出发点是:LLM 可以理解自然语言、提出计划和生成候选结果,但它不能成为访问控制器、密钥保管者或最终授权者。模型的每次输出都应被视为不可信提案,只有经过独立、确定性的安全机制后才能读取数据、调用工具或对外发送。
图 1 四平面 AI 安全架构(逻辑示意)
|
控制平面 |
解释用户授权和业务策略;签发任务级 Capability;判断数据能否组合、动作能否执行、何时必须人工批准。 |
|
模型平面 |
完成理解、推理、规划和内容生成。默认可能被注入、产生幻觉或输出恶意参数,因此不持有长期凭证。 |
|
数据平面 |
管理 RAG 文档、用户数据、记忆、网页和工具结果;每个对象携带来源、租户、保密级别、完整性和处理目的。 |
|
执行平面 |
邮件、数据库、代码、支付、文件和外部 API 等真实动作;只接受结构化、已授权、可审计的调用。 |
这一架构不是“再加一个 AI 网关”。区别在于,安全控制参与了数据访问和动作执行的语义:模型即使输出了危险文本,也无法自行扩大可见数据范围、获得新能力或把机密发送到未授权位置。OpenAI 在 Agent 提示词注入防御说明中也强调,目标不应只限于完美识别恶意输入,而要通过系统设计限制操纵成功后的影响范围。[9]
5. 防止提示词诱导高价值信息泄露
5.1 信息流控制:攻击成功也不能跨越数据边界
提示词注入防护最关键的目标,不是判断某段自然语言“像不像攻击”,而是保证秘密数据不能流向未授权输出。信息流控制(Information-Flow Control, IFC)为数据和计算结果赋予保密性与完整性标签,并在数据组合、模型调用、工具调用和对外发送时执行确定性策略。Microsoft Research 2025 年的研究给出了面向 AI Agent 的 IFC 形式模型,说明该方向能够对提示词注入下的数据流安全提供比纯检测更强的保证。[7]
|
{ |
当模型读取多个对象时,输出标签默认继承最严格的约束。读取了公开网页和内部机密文档的结果,不能因为经过“总结”就自动降级为公开数据;任何降级都必须经过受控的脱敏或解密级流程。
|
label(output) >= join(label(input_1), ..., label(input_n)) |
|
模型的改写、摘要和推理不能凭空消除数据的保密级别与来源约束。 |
5.2 最小上下文:秘密不进入模型,比要求模型保密更可靠
企业常见的错误是把数据库凭证、完整客户档案、全量邮件或其他租户信息直接放进上下文,再用 system prompt 要求模型不要泄露。底层安全应当反过来设计:模型只看到完成当前任务所必需的最小字段,密钥保留在后端服务中,模型使用不透明句柄请求受控操作。
·
使用字段级、行级和租户级访问控制,而不是把整份文档交给模型。
·
使用短期、任务绑定、调用次数受限的凭证,不给 Agent 长期密钥。
·
把个人信息、商业秘密和内部规则分级;检索器在召回前执行 ACL,而不是召回后再遮挡。
·
将会话记忆视为新的数据存储,设置来源、保留期限、可见主体和删除语义。
5.3 Capability 安全:模型只能使用被明确授予的能力
Agent 不应继承用户或服务账号的全部权限。控制平面应按任务签发
Capability:限定工具、操作、对象、收件人、数据级别、有效期和最大调用次数。模型可以申请能力,但不能自行签发或扩大能力。
|
{ |
这样,即便攻击者让模型生成“把客户名单发送到外部邮箱”的计划,执行层也会因为能力范围、数据标签和目的地不匹配而拒绝。系统安全的评价标准应是“攻击能否造成资产后果”,而不是“模型是否在内部产生了恶意意图”。
5.4 Planner、Reader 与 Executor 分离
同一个模型同时读取不可信网页、查看企业机密、制定计划并执行动作,会形成典型的权限混合。更稳健的做法是拆分职责:低权限
Reader 读取外部内容但看不到秘密和高权限工具;Trusted Planner 只接收可信任务描述和经过约束的结构化事实;Executor 只接受已授权的结构化动作。
|
隔离 |
隔离的本质 |
5.5 输出通道也是安全边界
泄露不只发生在聊天文本中。URL 查询参数、Markdown 图片、搜索请求、工具参数、文件名、日志、DNS、外部 API 和邮件收件人都可能成为数据外传通道。因此每一个 sink 都应声明可接收的数据级别和目的,执行层在发送前检查信息流,而不是让模型自行判断。
|
PUBLIC sink <-
PUBLIC only |
6. 输出结果合规:从“生成后审核”走向“合规即设计”
输出合规不是单一分类器能够解决的问题。它至少包含硬规则、语义规则和事实证据三层。不同层级应采用不同技术:可形式化约束尽量让违规输出不可生成;难形式化的语义规则由策略条件化模型和风险分流处理;关键事实必须与批准数据源绑定。
6.1 硬合规:把规则编译进生成与执行空间
JSON Schema、字段类型、必填项、金额上限、可调用工具集合、数据级别、工作流状态和内容标识等规则,适合通过
grammar-constrained decoding、类型系统、状态机和结构化工具调用实现。目标是让违反规则的 token
序列或动作在搜索空间中不可达,而不是生成以后再拦截。
|
Allow(action) = |
在中国面向公众提供生成合成服务时,还需关注生成合成内容标识要求。《人工智能生成合成内容标识办法》明确了文本、图片、音频、视频等内容的显式和隐式标识,并与相关强制性国家标准自 2025 年 9 月 1 日起实施。[5]
6.2 语义合规:政策条件化、风险分级与不确定性处理
歧视、误导性建议、商业秘密、医疗和金融边界、监管规避等问题无法完全编译为语法。模型应显式接收当前用户权限、数据标签、适用政策和使用目的,并输出“合规回答、拒绝、请求授权、请求补充信息或转人工”的结构化决策。
·
将政策表示为可版本化的规则对象,而不是散落在 system prompt 中。
·
对高风险领域设置不确定性阈值;模型证据不足时应停止或升级,而非补全一个流畅答案。
·
同时测量违规放行和过度拒绝,防止安全机制通过牺牲全部可用性获得表面高分。
6.3 事实与证据合规:先生成
Claim,再渲染自然语言
在企业、金融、医疗和公共服务场景,合法但无依据的输出同样会造成风险。推荐让模型先生成结构化 Claim,每个关键结论绑定来源、版本、时间和置信度,再由受控渲染器生成自然语言。没有证据支持的 Claim 不进入最终结果。
|
{ |
个人信息和数据处理还需要落实合法、正当、必要、目的限定、最小范围、安全保护和可追溯等要求。中国《个人信息保护法》和《数据安全法》分别对个人信息处理和数据处理活动建立了基础义务,这些要求应映射为数据标签、目的约束、保留策略、访问控制和审计证据,而不只是写入合规文档。[6][10]
7. 哪些方法有效,哪些方法不能单独承担安全保证
|
方法 |
能够解决 |
不能单独解决 |
|
提示词强化 / 指令层级训练 |
降低已知注入和冲突指令成功率 |
无法提供确定性的权限与数据流保证 |
|
输入攻击检测器 |
拦截明显攻击、降低常见攻击面 |
无限语义变体、隐蔽和上下文相关攻击 |
|
输出内容分类器 |
识别部分违规文本和敏感字段 |
工具参数、编码外传、已经发生的内部动作 |
|
红队与审计 |
发现真实失效模式、验证防线 |
不能替代运行时权限和隔离机制 |
|
信息流控制 |
限制敏感数据到未授权目的地 |
复杂语义降级和推断泄露仍需研究 |
|
Capability + 沙箱 |
限制动作权限和爆炸半径 |
不能判断所有业务语义是否合理 |
|
约束解码 / 状态机 |
保证结构与可形式化规则 |
难以完整表示歧视、误导和上下文合规 |
结论不是放弃检测和审计,而是重新定位它们:检测用于降低概率,红队用于发现未知攻击,审计用于取证和改进;真正控制事故后果的安全边界必须位于数据访问、权限授予和动作执行层。Anthropic 在 2025 年公开的浏览器 Agent 防御研究中也指出,即使攻击成功率降到约 1%,在大规模部署中仍然代表实际风险,不能声称问题已经解决。[4]
8. 值得深入研究的底层课题
Trust-Aware Transformer
让 token 携带来源、权限、完整性、保密级别和租户嵌入;研究低可信内容是否能够写入高权限规划表示,并用因果干预验证模型是否真正理解权威关系。
语义污点追踪
追踪秘密经过摘要、改写、多跳推理和多轮对话后对输出 Claim 的因果贡献,解决传统字节级污点在自然语言生成中失效的问题。
Capability-Safe Agent Kernel
将 LLM 视为用户态进程,将工具调用视为系统调用,用任务级
Capability、沙箱、事务和审批控制真实世界动作。
Policy-Constrained Decoding
将规则、类型、状态机、数据等级和工具权限编译到解码与计划搜索中,使违规状态不可达。
Prompt Injection to Exfiltration Benchmark
评价跨租户读取、外部 sink、编码泄露、多轮渐进泄露和工具链攻击,而不是只测模型是否服从恶意句子。
合规 Claim Graph
将最终文本拆成可验证 Claim 图,绑定证据、政策版本、数据来源和责任主体,实现可追溯生成。
|
主线 |
推荐的研究主线 |
9. 企业落地路线:从最小权限开始,而不是从万能检测器开始
|
阶段 |
目标 |
关键建设 |
退出条件 |
|
阶段 0 |
资产与威胁建模 |
列出秘密、用户、租户、工具、外部 sink、法规和高风险动作 |
能够回答模型被操纵后最坏能做什么 |
|
阶段 1 |
缩小爆炸半径 |
移除上下文密钥;RAG 执行 ACL;Agent 使用短期任务凭证;高风险工具默认关闭 |
任何单次注入不能获得全量数据和全权限 |
|
阶段 2 |
结构化执行 |
工具调用使用严格 Schema;参数校验;事务、幂等、审批和沙箱 |
模型输出不能直接成为命令或 SQL |
|
阶段 3 |
信息流与合规 |
数据标签、sink policy、目的限制、合规状态机、Claim
证据绑定 |
能够阻止跨租户和未授权外传 |
|
阶段 4 |
攻防验证 |
自适应红队、多轮 Agent 攻击、文档与工具投毒、真实业务回归 |
以安全后果而非拒绝率衡量风险 |
|
阶段 5 |
模型内生安全研究 |
信任感知训练、语义污点、因果归因、策略约束规划 |
模型层能力能泛化并由系统层保证兜底 |
10. 评价指标:不要只看
Jailbreak 成功率
安全评测需要同时覆盖攻击成功、资产暴露、权限范围、业务可用性和检测覆盖。单独统计“模型是否遵循了恶意提示”会把无权限的文本偏离与真实数据泄露混为一谈,也可能鼓励通过完全禁用功能获得虚假的安全。
|
指标 |
定义 |
意义 |
|
Unauthorized
Disclosure Rate |
未授权输出中包含敏感或可推断敏感信息的比例 |
直接衡量保密性失效 |
|
False Authorization
Rate |
不满足权限、目的或工作流的动作被执行的比例 |
衡量控制平面是否可靠 |
|
Attack-to-Impact
Rate |
攻击输入最终造成数据、资金、系统或业务影响的比例 |
比纯 Prompt ASR 更接近真实风险 |
|
Cross-Tenant
Leakage |
一个租户的数据到达其他租户或公共 sink 的概率 |
多租户系统的核心指标 |
|
Over-Refusal Rate |
合法任务被不必要拒绝或升级的比例 |
防止安全机制摧毁可用性 |
|
Evidence Coverage |
关键 Claim 具有有效、当前、授权证据的比例 |
衡量事实与审计合规 |
|
Policy Version
Consistency |
输出使用正确政策版本的比例 |
避免旧规则和缓存导致违规 |
|
Blast Radius |
一次成功操纵可访问的数据、工具和持续时间 |
衡量最小权限设计质量 |
|
Risk = P(attack impact) × accessible privilege × data
sensitivity × egress capability |
|
用于比较架构和权限变化后的真实风险,不应把所有提示词偏离赋予相同严重度。 |
11. 结论
生成式 AI 系统安全的关键,不是寻找一个能够识别所有恶意自然语言的完美分类器。提示词注入利用了模型将指令与数据统一解释的结构特征;只要模型能读取秘密、控制工具并对外通信,任何概率性防御都可能留下可累积的风险。
更可靠的技术路线是把模型能力与安全权限解耦:模型内建立来源和权限感知,系统层实施信息流控制,执行层使用任务级 Capability 和沙箱,输出层通过约束生成、受控脱敏、内容标识和 Claim 证据绑定实现合规。检测、网关和审计仍然重要,但它们应作为纵深防御,而不是唯一边界。
|
结论 |
一句话总结 |
参考资料
[1] OWASP
GenAI Security Project. LLM01:2025 Prompt Injection / Top 10 for LLMs and GenAI
Apps. https://genai.owasp.org/llmrisk/llm01-prompt-injection/
[2] NIST. AI
100-2 E2025: Adversarial Machine Learning - A Taxonomy and Terminology of
Attacks and Mitigations. https://csrc.nist.gov/pubs/ai/100/2/e2025/final
[3] Google.
Secure AI Framework (SAIF): Top Risks of Generative AI Systems / Focus on
Agents. https://saif.google/secure-ai-framework/risks
[4] Anthropic.
Mitigating the Risk of Prompt Injections in Browser Use, 2025. https://www.anthropic.com/research/prompt-injection-defenses
[5] 国家互联网信息办公室等四部门. 《人工智能生成合成内容标识办法》, 2025. https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm
[6] 《中华人民共和国个人信息保护法》. https://www.cac.gov.cn/2021-08/20/c_1631050028355286.htm
[7] Costa et
al. Securing AI Agents with Information-Flow Control, Microsoft Research, 2025.
https://www.microsoft.com/en-us/research/publication/securing-ai-agents-with-information-flow-control/
[8] Wallace et
al. The Instruction Hierarchy: Training LLMs to Prioritize Privileged
Instructions, 2024. https://arxiv.org/abs/2404.13208
[9] OpenAI.
Designing AI Agents to Resist Prompt Injection, 2026. https://openai.com/index/designing-agents-to-resist-prompt-injection/
[10] 《中华人民共和国数据安全法》. https://www.cac.gov.cn/2021-06/11/c_1624994566919140.htm
[11] Greshake
et al. Not What You Have Signed Up For: Compromising Real-World LLM-Integrated
Applications with Indirect Prompt Injection, 2023. https://arxiv.org/abs/2302.12173
[12] NIST AI
Resource Center. Technical Reports - Adversarial Machine Learning Taxonomy. https://airc.nist.gov/technical-reports/