中文

论完美AI对齐的复杂性——关于RLHF三元谜题的形式化

机器学习 2025-11-26 v1 机器学习

摘要

强化学习从人类反馈(RLHF)是对齐大型语言模型的常用方法,但实践者面临持久的谜题:提高安全性往往削弱公平性,扩展到多样人群的规模在计算上难以可行,且提升鲁棒性常放大多数偏见。我们将这一张力形式化为对齐三元谜题:不存在任何RLHF系统可同时实现(i)跨多样人类价值观的 epsilon-representativeness;(ii)样本与计算复杂度的多项式可行性;(iii)针对对抗性扰动与分布迁移的 delta-robustness。通过复杂度理论分析融合统计学习理论与鲁棒优化,我们证明实现全球规模人群的 representativeness(epsilon <= 0.01)与 robusteness(delta <= 0.001)需 Omega(2^{d_context}) 操作,呈指数级增长。我们指出当前RLHF实现通过牺牲 representativeness 解决该谜题:仅收集10^3--10^4个来自同质标注者池的样本,而实现真正全局 representativeness 需要10^7--10^8个样本。我们的框架为RLHF已记录的症状(偏好崩溃、顺从现象及系统性偏见放大)提供统一解释。我们结论提出,通过策略性放宽对齐要求,探索这些根本性权衡的具体路径。

关键词

引用

@article{arxiv.2511.19504,
  title  = {Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma},
  author = {Subramanyam Sahoo and Aman Chadha and Vinija Jain and Divya Chaudhary},
  journal= {arXiv preprint arXiv:2511.19504},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)