中文

失控 -- 为什么对齐需要形式控制理论(以及对齐控制堆栈)

人工智能 2025-06-24 v1

摘要

本立场论文论证认为,形式最优控制理论应是AI对齐研究的核心,提供了与现行AI安全与安全方法截然不同的视角。尽管近期在AI安全和机制可解释性方面的工作已为AI对齐推进形式方法,但这些方法往往不足以满足来自其他技术领域控制框架所需的泛化能力。还缺乏研究如何使不同的对齐/控制协议相互兼容。我们认为,通过将对齐重新诠释为形式最优控制的原则,并将对齐表述为根据可应用控制的物理层面到社会技术层面的层次化堆栈,我们可以更好地理解控制前沿模型和代理AI系统的潜力与局限性。为此,我们引入了一个对齐控制堆栈(Alignment Control Stack),该堆栈界定了一个层次化的对齐堆栈,确定每个层面的测量和控制特征以及不同层之间的形式互操作性。我们认为,这种分析也是政府和监管机构所需的保证,以确保AI技术可持续地惠及社区所必需的关键因素。我们的立场是,通过将已建立且经实证验证的最优控制方法与实际部署考虑因素相结合,以创建更全面的对齐框架,从而增强我们如何处理先进AI系统的安全性和可靠性。

关键词

引用

@article{arxiv.2506.17846,
  title  = {Out of Control -- Why Alignment Needs Formal Control Theory (and an Alignment Control Stack)},
  author = {Elija Perrier},
  journal= {arXiv preprint arXiv:2506.17846},
  year   = {2025}
}

备注

Under review for Neurips 2025