通过分权架构在 AI 代理中强制实现目标完整性
人工智能
2026-04-28 v1 密码学与安全
摘要
近期证据表明,前沿 AI 系统可能表现出代理性错位,生成并执行源于内部构建目标的有害动作,即便没有明确的用户请求。现有缓解方法(如基于人类反馈的强化学习(RLHF)和宪法提示)主要在模型层面运行,仅能提供概率安全保证。我们提出了政策-执行-授权(PEA)架构,一种在系统层面强制执行安全措施的“分权”设计。PEA 将意图生成、授权和执行解耦为独立、受隔离的层级,通过加密受限能力令牌相连。我们提出了五项核心贡献:(C1)意图验证层(IVL),用于确保能力-意图一致性;(C2)意图血统追踪(ILT),通过加密锚点将所有可执行意图绑定到最初的用户请求;(C3)目标漂移检测,通过可配置阈值拒绝语义上不一致的意图;(C4)输出语义门(OSG),使用结构化的 K × I × P 威胁微积分(知识、影响、政策)检测隐式胁迫;(C5)形式化验证框架,证明即使在恶意模型 compromise 下,目标完整性仍被维持。通过将代理对齐从一种行为属性转变为结构性强制系统约束,PEA 为自主代理的治理提供了稳健的基础。
引用
@article{arxiv.2604.23646,
title = {Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture},
author = {Rong Xiang},
journal= {arXiv preprint arXiv:2604.23646},
year = {2026}
}