中文

为何RLAIF会工作?

机器学习 2026-03-04 v1 人工智能

摘要

强化学习AI反馈(RLAIF)使语言模型能够通过训练自身偏好判断来自我改进,然而尚无理论阐释解释为何这种自我改进在价值学习中看似有效。我们提出潜在价值假设,即在大规模数据预训练中编码的人类价值作为表示空间中的方向, constitutional提示(constitution)则激发这些潜在价值转化为偏好判断。我们在线性模型下形式化该直觉,其中宪法充当选择价值相关方向的投影算子。我们的分析得出若干结论:当宪法激活的方向与真实价值相关性优于模型默认生成方向时,RLAIF可改善对齐,从而解释生成-判断间的差距;RLAIF质量上限取决于表示如何编码价值,这与模型容量成正比;以及存在对抗性宪法可激活来自有害预训练数据中编码的反社会价值方向。我们的论述统一了包括拒绝方向、低秩安全子空间以及RLAIF规模行为等若干实证发现。

关键词

引用

@article{arxiv.2603.03000,
  title  = {Why Does RLAIF Work At All?},
  author = {Robin Young},
  journal= {arXiv preprint arXiv:2603.03000},
  year   = {2026}
}