中文

扩展密码学正式化与理论基础以适用于 AI

密码学与安全 2026-03-04 v1

摘要

近期 (大型) 语言模型的进展使得能够开发出能够执行复杂任务且几乎无需监督的自主语言模型智能体。这些智能体已开始被集成到具有显著自主性和权威性的系统中。安全社区正研究其安全性。一个新兴方向是通过访问控制和权限机制来约束智能体的行为。然而,现有的权限提议缺乏统一的形式化基础,导致难以进行比较。本工作提供了这样的基础。我们首先通过构建针对语言模型的攻击分类法来系统化图景,这些是智能体系统的计算原语。随后,我们通过算法定义 AIOracle 并引入安全博弈框架来正式化智能体访问控制,该框架捕捉完整性(在无对手情况下的完整性)和对抗鲁棒性。我们的安全博弈将机密性、完整性和可用性统一于单个模型中。使用该框架,我们表明现有的训练数据机密性方法在完整性方面根本与冲突。最后,我们形式化地分解有用性和无害性目标的模块化方法,并证明其完备性,以便于原则性地推理智能体系统设计的安全性。我们的研究表明,如果要设计一个具有可衡量安全性的系统,那么我们可能希望采用模块化方法将问题分解为子问题,并让不同模块的组合完成设计。我们的研究表明,这种自然方法配合相关形式化手段是证明安全性归约所必需的。

关键词

引用

@article{arxiv.2603.02590,
  title  = {Extending the Formalism and Theoretical Foundations of Cryptography to AI},
  author = {Federico Villa and F. Betül Durak and Tadayoshi Kohno and Tapdig Maharramli and Franziska Roesner},
  journal= {arXiv preprint arXiv:2603.02590},
  year   = {2026}
}