面向自主AI系统的加密运行时治理:可验证政策执行的Aegis架构
密码学与安全
2026-03-19 v1 人工智能
计算机与社会
摘要
当代AI治理框架依赖大量事后监督、政策指导和行为对齐技术,但随着系统获得自主性、速度和操作不透明度,这些机制变得脆弱。本文提出Aegis,一种面向自主AI系统的运行时治理架构,将政策和法律约束视为执行条件而非指导原则。Aegis在系统生成时将每个被治理的代理人绑定到加密封存的不可变伦理政策层(IEPL),并通过伦理验证代理人(EVA)、执行内核模块(EKM)和不可变日志内核(ILK)强制执行外部输出。治理政策层的修改需要多数批准和系统信任根的重新声明;经验证的违规行为触发自主关机并生成可审计的证据制品。我们在Civitas运行时环境中评估了该架构,使用三项运行时措施进行评估:在篡改条件下的证明验证延迟、发布开销以及相对于未受治理基线的对齐保持性能。受控试验中,Aegis显示出中位证明验证延迟为238毫秒,中位发布开销约为9.4毫秒,以及相较于基线条件在匹配任务上的更高对齐保持性能。我们认为,这些结果支持将AI治理从自愿性监督转向可验证运行时约束的论点。本文不主张在抽象层面解决机器伦理问题,而是旨在展示在受控运行时治理框架中,违反政策的行为可以被实现为不可执行。本文 concludes by讨论方法论限制、证据含义以及面向高保证AI部署的证明导向治理的作用。
引用
@article{arxiv.2603.16938,
title = {Cryptographic Runtime Governance for Autonomous AI Systems: The Aegis Architecture for Verifiable Policy Enforcement},
author = {Adam Massimo Mazzocchetti},
journal= {arXiv preprint arXiv:2603.16938},
year = {2026}
}