Parallax:为何必须永远不要让AI代理行动
摘要
自主AI代理正快速从实验工具转变为操作基础设施,据预测,到2026年底,80%的企业应用将嵌入AI copilot。随着代理 gaining the ability to execute real-world actions(读取文件、运行命令、make network requests、修改数据库),一个根本性的安全缺口已然显现。主导方法是依赖于基于提示的安全措施: operate at the same abstraction level as the threats they attempt to mitigate。本文论证基于提示的安全在具备执行能力的代理上在结构上是不够的,并引入Parallax范式,该范式基于四个原则:认知-执行分离(Cognitive-Executive Separation),从结构上防止推理系统执行动作;对抗性验证与渐进确定性(Adversarial Validation with Graduated Determinism),在推理和执行之间插入独立的、多层次的验证器;信息流控制(Information Flow Control),将数据敏感性标签传递 through agent workflows以检测情境依赖的威胁;可逆执行(Reversible Execution),捕获破坏性操作前的状态,以在验证失败时进行回滚。我们present了OpenParallax,这是一个在Go中实现的开源参考实现,并使用Assume-Compromise Evaluation方法进行评估,该方法完全绕过推理系统,以测试在代理完全被破坏情况下的架构边界。在280个对抗测试案例中(涵盖九个攻击类别),Parallax在默认配置下以98.9%的拦截率(0个误报)和在最大安全配置下100%的拦截率成功阻止了攻击。当推理系统被破坏时,基于提示的安全措施提供零保护,因为它们仅存在于被破坏的系统内部;Parallax的架构边界在任何情况下都保持稳固。
引用
@article{arxiv.2604.12986,
title = {Parallax: Why AI Agents That Think Must Never Act},
author = {Joel Fokou},
journal= {arXiv preprint arXiv:2604.12986},
year = {2026}
}
备注
20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues