中文

别忘了你的奖励值:基于价值校准的语言模型对齐

计算与语言 2024-02-27 v1 人工智能

摘要

虽然基于人类反馈的强化学习(RLHF)显著提升了大型语言模型(LLM)的生成质量,但最近的研究对近端策略优化(PPO)算法相关的复杂性和不稳定性提出了担忧,并提出了一系列基于顺序的校准方法作为可行的替代方案。本文进一步深入研究了当前的基于顺序的方法,检查了它们在利用奖励值和解决对齐问题方面的低效性。基于这些发现,我们提出了一种新颖的基于价值的校准(VCB)方法,以更好地使LLM与人类偏好对齐。实验结果表明,VCB在AI助手和摘要数据集上超越了现有的对齐方法,在不同设置下提供了令人印象深刻的泛化性、鲁棒性和稳定性。

关键词

引用

@article{arxiv.2402.16030,
  title  = {Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration},
  author = {Xin Mao and Feng-Lin Li and Huimin Xu and Wei Zhang and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2402.16030},
  year   = {2024}
}

备注

19 pages, Under review