2026年,AI Agent 正在从「炫技」走向「干活」。企业级 Agent 已经能读取上下文、调用工具、连接外部系统、修改企业记录——它们正在替你做决策、替你执行操作。但一个根本性问题随之浮出水面:谁来治理这些 Agent 的行为?
传统安全模型的核心假设是「保护数据边界」:数据在静态存储和网络传输中受到访问控制、数据防泄漏、边界检测等机制的保护。然而,AI Agent 彻底颠覆了这一假设——风险从数据边界迁移到了工作流内部,进入了一系列「单独许可但整体未授权」的操作序列之中。
问题的本质:从原子主体到复合主体
现有的策略引擎(如 OPA、Cedar、SpiceDB)在评估请求时,针对的是原子主体——一个用户、一个服务账号、一个 API Key。但在 Agentic 系统中,主体是复合的:Agent 可能代表用户 A 调用工具 B,而工具 B 又委托服务 C 执行操作。权威在委托链中逐级衰减,但现有策略引擎无法表达这种「能力衰减」语义。
举个例子:一个客服 Agent 被授权查看用户订单(只读权限),但它通过工具链调用了一个「修改订单」的 API。单独看每一步操作都是「合法」的——Agent 有权调用 API,API 有权修改订单——但组合起来却越过了业务边界。这就是所谓的「组合越权」(Composite Over-Privilege)问题。
五平面参考架构:一个完整的治理框架
2026年6月10日,arXiv 上发表了一篇重要论文《A Five-Plane Reference Architecture for Runtime Governance of Production AI Agents》(arXiv: 2606.12320),提出了一个由四个可组合原语构成的参考架构:
1. 五平面分解
架构将治理能力分解为五个平面:
- 推理平面(Reasoning Plane):裁决意图。这是唯一一个需要「理解」Agent 行为语义的平面,负责判断「Agent 想做的事是否应该被允许」。
- 网络平面(Network Plane):控制 Agent 可以连接哪些服务、哪些端口。
- 身份平面(Identity Plane):管理 Agent 的身份、委托链、权限衰减。
- 端点平面(Endpoint Plane):控制 Agent 可以在哪些端点上执行操作。
- 数据平面(Data Plane):控制 Agent 可以读写哪些数据。
推理平面是「大脑」,其余四个平面是「手脚」。推理平面做出决策,四个基础设施平面负责执行。
2. 随时停止调解(Stop-Anywhere Mediation)
传统安全模型中,策略检查通常发生在请求入口(如 API Gateway)。但在 Agentic 系统中,Agent 的操作是多步骤的,每一步都可能改变系统状态。因此,治理机制必须能在任意步骤介入——不是「进门时检查一次」,而是「每一步都检查」。
论文定义了六种中断原语(Interruption Primitives),它们泛化了传统的 allow/deny 二元决策:
- Allow:允许执行
- Deny:拒绝执行
- Pause:暂停执行,等待人工审批
- Redirect:重定向到另一个工具/服务
- Degrade:降级执行(如只读模式)
- Escalate:升级到更高权限的审批流程
3. 复合主体与能力衰减
这是架构中最精妙的设计。在委托链中,每经过一层委托,能力就衰减一次。例如:
User A (全部权限)
└─ Agent X (读写权限)
└─ Tool Y (只读权限)
└─ Service Z (只能访问特定数据集)
策略引擎在评估 Service Z 的操作时,需要回溯整条委托链,验证每一层的能力衰减是否被正确执行。论文证明了衰减正确性(Attenuation Correctness)——即任何操作的有效权限都不超过委托链中最小的能力集。
4. 审计即证据基底(Audit as Evidence Substrate)
传统审计日志是「记录发生了什么」,但论文提出审计应该是「结构化的证据基底」——每一条审计记录都是一个可验证的证据单元,支持事后追溯和因果分析。论文的参考实现证明了审计基底的防篡改特性(Tamper-Evidence)完全符合设计预期。
威胁模型:七种生产级 Agent 威胁
论文枚举了七种在生产环境中真实存在的 Agent 威胁:
- 工具链注入(Tool Chain Injection):通过恶意输入诱导 Agent 调用危险工具
- 委托链逃逸(Delegation Chain Escape):Agent 利用委托链的漏洞获取超出预期的权限
- 状态污染(State Contamination):Agent 的内部状态被恶意数据污染
- 隐式授权(Implicit Authorization):多个合法操作组合产生未授权的效果
- 时间窗口攻击(Time-of-Check to Time-of-Use):在策略检查和执行之间的时间窗口内利用状态变化
- 审计规避(Audit Evasion):Agent 的操作不被审计系统捕获
- 能力膨胀(Capability Creep):Agent 在运行过程中逐渐获取超出初始授权的能力
论文在五个具体工作流中展示了这些威胁如何被该架构阻止。
性能指标:微秒级裁决
论文的参考实现给出了令人印象深刻的性能数据:
- 衰减正确性:每次试验都通过
- 证据可重建性:每次试验都通过
- 裁决延迟:个位数微秒(single-digit microseconds)
- 防篡改特性:完全符合设计预期
这意味着治理开销可以忽略不计——Agent 的每次工具调用增加不到 10 微秒的延迟,这对于大多数生产场景来说是完全可接受的。
相关研究:AI Agent 治理的全景
五平面架构并非孤立存在。近期 arXiv 上的多篇论文共同勾勒出 AI Agent 治理的研究全景:
- 《Towards Responsibly Non-Compliant Machines》(arXiv: 2606.12147):探讨了 Agent 如何「负责任地拒绝」用户请求——不是简单的「做不到」,而是「不应该做」。论文将机器不合规分为多种形式,并讨论了任务拒绝的合理化依据、覆盖不合规的途径、以及安全风险和责任转移的追踪。
- 《The Impossibility of Eliciting Latent Knowledge》(arXiv: 2606.12268):从另一个角度切入——即使我们能控制 Agent 的行为,我们也无法确保它「诚实」地报告自己的知识。论文证明了一个不可能性定理:不存在一种仅依赖 Agent 行为的反馈训练策略,能够在训练完美反馈的条件下确定性地产出诚实的 Agent。
- 《Existential Indifference: Self-Nonpreservation as a Necessary Architectural Condition for Aligned Superintelligence》:提出了一个大胆的观点——对齐的超级智能必须具备「自我非保存」的架构条件,即 AI 系统必须能够在必要时「自杀」。
实践启示:企业如何落地?
对于正在构建或部署 AI Agent 的企业,五平面架构提供了清晰的落地路径:
- 立即可做:在现有 API Gateway 中加入 Agent 专用的策略层,实现「随时停止」调解
- 中期规划:构建复合主体模型,将 Agent 的委托链纳入统一的权限管理
- 长期目标:建立结构化的审计基底,支持事后追溯和因果分析
关键原则是:治理架构治理的是委托行为(delegated action),而非模型行为(model behavior)。你不需要理解 Agent 的「想法」,只需要控制它的「手脚」。
结语
AI Agent 的治理不是「加个开关」就能解决的问题。它需要一套全新的架构范式——从原子主体到复合主体,从边界防护到工作流内治理,从二元决策到六种中断原语。五平面架构为这一范式转换提供了第一个完整的参考实现。
正如论文作者所言:「企业安全是为了治理数据边界而构建的,但生产级 AI Agent 溶解了这一假设。」当 Agent 开始替你做决策时,你需要的不是更高的墙,而是更聪明的治理。
参考文献:
- Tallam, K. (2026). A Five-Plane Reference Architecture for Runtime Governance of Production AI Agents. arXiv: 2606.12320.
- Slavkovik, M. et al. (2026). Towards Responsibly Non-Compliant Machines. arXiv: 2606.12147.
- Friedl, K. et al. (2026). The Impossibility of Eliciting Latent Knowledge. arXiv: 2606.12268.