直接优势回归:与在线 AI 奖励对齐
人工智能
2025-04-22 v1 计算与语言
人机交互
摘要
在线 AI 反馈(OAIF)作为以 AI 偏好进行语言模型对齐的新方法,为强化学习从人类反馈(RLHF)提供了有前景的替代方案。然而,直接用 AI 替代人类,使得语言模型无法学习超越二元信号的更细粒度的 AI 监督。本文提出了直接优势回归(DAR),这是一种简单的数据对齐算法,利用在线 AI 奖励通过加权监督微调来优化策略改进。作为一种无 RL 方法,DAR 在理论上与在线 RLHF 流程保持一致,同时显著降低了实现复杂度并提高了学习效率。我们的实证结果表明,AI 奖励作为 AI 监督形式,持续实现更高的人类-AI 一致性,优于 AI 偏好。此外,使用 GPT-4-Turbo 和 MT-bench 评估显示,DAR 在 OAIF 和在线 RLHF 基线中均取得了优异性能。
引用
@article{arxiv.2504.14177,
title = {Direct Advantage Regression: Aligning LLMs with Online AI Reward},
author = {Li He and He Zhao and Stephen Wan and Dadong Wang and Lina Yao and Tongliang Liu},
journal= {arXiv preprint arXiv:2504.14177},
year = {2025}
}