基于好奇心驱动的人类反馈强化学习
计算与语言
2025-06-03 v2
摘要
强化学习从人类反馈(RLHF)在与人类偏好一致方面已被证明有效,但往往以输出多样性降低为代价。这种在多样性和对齐质量之间的 trade-off 仍是重要挑战。drawn inspiration from curiosity-driven exploration in reinforcement learning, we introduce curiosity-driven RLHF(CD-RLHF),一种将对 novel states 的内在奖励(与传统稀疏外在奖励并行)的框架,以优化输出的多样性和对齐质量。我们通过在多个任务上的大量实验展示了 CD-RLHF 的有效性,包括文本摘要和指令遵循。我们的做法在多个以多样性为导向的指标上实现了显著的多样性提升,同时保持与标准 RLHF 相当的人类偏好对齐。我们将代码公开于 https://github.com/ernie-research/CD-RLHF。
关键词
引用
@article{arxiv.2501.11463,
title = {Curiosity-Driven Reinforcement Learning from Human Feedback},
author = {Haoran Sun and Yekun Chai and Shuohuan Wang and Yu Sun and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2501.11463},
year = {2025}
}
备注
ACL 2025