中文

工具增强的奖励建模

计算与语言 2024-02-13 v2

摘要

奖励建模(亦称偏好建模)对于使大语言模型与人类偏好对齐至关重要,尤其在基于人类反馈的强化学习(RLHF)中。尽管传统奖励模型(RM)已展现出显著的可扩展性,它们常在算术计算、代码执行和事实查询等基本功能上表现不佳。本文提出一种名为 Themis 的工具增强偏好建模方法,通过赋予 RM 访问包括计算器和搜索引擎在内的外部环境的权限来解决这些局限。该方法不仅促进了工具利用与奖励评定的协同,还增强了可解释性与评分可靠性。我们的研究深入探讨了将外部工具集成到 RM 中,使其以自回归方式同多样化外部源交互并构建任务特定的工具参与与推理轨迹。我们在广泛领域中验证该方法,融入了七种不同外部工具。实验结果表明,在八个任务的偏好排序上总体提升达 17.7%。此外,在零样本评估中,我们的方法在 TruthfulQA 任务上以 7.3% 的优势超越 Gopher 280B。在人类评估中,使用 Themis 训练的 RLHF 在四个不同任务上相较基线取得平均 32% 的胜率。另外,我们提供了全面的工具相关 RM 数据集,涵盖七种不同工具 API 的数据,总计 15000 条样本。我们已公开代码、数据与模型检查点,以推动并启发进一步的研究进展\footnote{\url{https://github.com/ernie-research/Tool-Augmented-Reward-Model}}。

关键词

引用

@article{arxiv.2310.01045,
  title  = {Tool-Augmented Reward Modeling},
  author = {Lei Li and Yekun Chai and Shuohuan Wang and Yu Sun and Hao Tian and Ningyu Zhang and Hua Wu},
  journal= {arXiv preprint arXiv:2310.01045},
  year   = {2024}
}

备注

ICLR 2024 Spotlight