中文

对齐博弈:通过递归策展实现长程对齐的理论

机器学习 2025-11-18 v1 人工智能

摘要

在基于自身输出进行训练的自我消耗(self-consuming)生成模型中,与用户偏好的对齐变成了一个递归过程而非一次性过程。我们为分析这种递归再训练对对齐的长期影响提供了首个形式化基础。在基于Bradley-Terry(BT)模型的两阶段策展机制下,我们将对齐建模为两个阵营之间的交互:模型所有者(Model Owner),其筛选模型应当学习的输出;以及公共用户(Public User),其通过与模型的交互决定哪些输出最终被分享和保留。我们的分析揭示了三种依赖于偏好对齐程度不同的结构收敛区域:共识崩溃、在共享最优上的折中,以及非对称细化。我们证明了一个基本的不可能性定理:不存在基于递归BT的策展机制能够同时保持多样性、确保对称影响并消除对初始化的依赖。将该过程框定为动态社会选择,我们表明对齐并非一个静态目标,而是一个不断演化的均衡,既受权力不对称的影响,也受路径依赖的影响。

关键词

引用

@article{arxiv.2511.12804,
  title  = {The Alignment Game: A Theory of Long-Horizon Alignment Through Recursive Curation},
  author = {Ali Falahati and Mohammad Mohammadi Amiri and Kate Larson and Lukasz Golab},
  journal= {arXiv preprint arXiv:2511.12804},
  year   = {2025}
}