中文

D2PO:基于响应评估模型的判别器引导 DPO

计算与语言 2024-08-08 v2

摘要

目前已提出多种对齐语言模型的方法,包括监督微调、RLHF 以及如 DPO 等直接优化方法。尽管 DPO 因其直接的训练过程和有竞争力的结果而迅速普及,但使用判别器(如奖励模型)来评估响应是否仍具有实际优势,仍是一个开放性问题。我们提出了 D2PO,即判别器引导的 DPO,这是一种适用于在整个学习过程中持续收集偏好数据的在线场景的方法。在收集黄金偏好的同时,我们不仅将其用于训练策略,还用于训练判别式响应评估模型,以便为更多用于策略训练的合成数据提供银标签。我们在一组多样化任务(包括真实的聊天场景)中探索了该方法,发现与在相同数据预算下的 DPO 相比,我们的方法能产生更高质量的输出,并且在偏好数据需求方面具有更高的效率。此外,我们展示了银标签最有帮助的条件:在使用 DPO 训练策略时最为有效,优于传统的 PPO,并且受益于保持与策略模型分离的独立判别器。

关键词

引用

@article{arxiv.2405.01511,
  title  = {D2PO: Discriminator-Guided DPO with Response Evaluation Models},
  author = {Prasann Singhal and Nathan Lambert and Scott Niekum and Tanya Goyal and Greg Durrett},
  journal= {arXiv preprint arXiv:2405.01511},
  year   = {2024}
}

备注

20 pages, 12 figures, Accepted to COLM 2024