中文

全栈对齐:与厚模型价值共同对齐 AI 与制度

机器学习 2025-12-04 v1

摘要

通过对单个 AI 系统与其操作者或用户意图的对齐,无法保证有益的社会结果。即使一个 AI 系统完全对齐了其运营组织的意图,也可能因该组织的目标与其他机构和个人的目标不对齐而导致不良结果。因此,我们需要全栈对齐,即 AI 系统与塑造它们的制度能够与人们所看重的价值观相一致。这可以在不施加特定个人或集体繁荣愿景的前提下实现。我们认为,当前用于表示价值观的方法,如效用函数、偏好排序或非结构化文本,在有效应对这些问题及其他问题方面仍有挑战。它们在区分价值观与其他信号、支持原则规范推理以及建模集体公共物方面都不足。我们提出,需要厚模型价值(thick models of value)。这些模型能够结构化价值观和规范的表示方式,使系统能够区分持久的价值观与短暂的偏好,建模个人选择的社会嵌入性,并进行规范性推理,在新领域中应用价值观。我们在五个领域展示了这一方法:AI 价值管 stewardship、规范性 competent 代理人、赢得-赢得谈判系统、意义保持经济机制以及民主监管机构。

关键词

引用

@article{arxiv.2512.03399,
  title  = {Full-Stack Alignment: Co-Aligning AI and Institutions with Thick Models of Value},
  author = {Joe Edelman and Tan Zhi-Xuan and Ryan Lowe and Oliver Klingefjord and Vincent Wang-Mascianica and Matija Franklin and Ryan Othniel Kearns and Ellie Hain and Atrisha Sarkar and Michiel Bakker and Fazl Barez and David Duvenaud and Jakob Foerster and Iason Gabriel and Joseph Gubbels and Bryce Goodman and Andreas Haupt and Jobst Heitzig and Julian Jara-Ettinger and Atoosa Kasirzadeh and James Ravi Kirkpatrick and Andrew Koh and W. Bradley Knox and Philipp Koralus and Joel Lehman and Sydney Levine and Samuele Marro and Manon Revel and Toby Shorin and Morgan Sutherland and Michael Henry Tessler and Ivan Vendrov and James Wilken-Smith},
  journal= {arXiv preprint arXiv:2512.03399},
  year   = {2025}
}