中文

直接优势回归:与在线 AI 奖励对齐

人工智能 2025-04-22 v1 计算与语言 人机交互

摘要

在线 AI 反馈(OAIF)作为以 AI 偏好进行语言模型对齐的新方法,为强化学习从人类反馈(RLHF)提供了有前景的替代方案。然而,直接用 AI 替代人类,使得语言模型无法学习超越二元信号的更细粒度的 AI 监督。本文提出了直接优势回归(DAR),这是一种简单的数据对齐算法,利用在线 AI 奖励通过加权监督微调来优化策略改进。作为一种无 RL 方法,DAR 在理论上与在线 RLHF 流程保持一致,同时显著降低了实现复杂度并提高了学习效率。我们的实证结果表明,AI 奖励作为 AI 监督形式,持续实现更高的人类-AI 一致性,优于 AI 偏好。此外,使用 GPT-4-Turbo 和 MT-bench 评估显示,DAR 在 OAIF 和在线 RLHF 基线中均取得了优异性能。

关键词

引用

@article{arxiv.2504.14177,
  title  = {Direct Advantage Regression: Aligning LLMs with Online AI Reward},
  author = {Li He and He Zhao and Stephen Wan and Dadong Wang and Lina Yao and Tongliang Liu},
  journal= {arXiv preprint arXiv:2504.14177},
  year   = {2025}
}