使用后续似然作为奖励信号对齐语言模型
计算与语言
2025-02-25 v3
摘要
在自然的人与人对话中,参与者经常根据彼此的后续反应接收反馈信号。这些反应可以包括言语回应、面部表情、情绪状态变化以及其他非言语线索。类似地,在人机交互中,机器可以利用用户的后续话语作为反馈信号,以评估其是否恰当地处理了用户的请求。因此,我们提出使用后续话语的似然作为奖励,以区分偏好响应与较不受欢迎的响应,而无需依赖人类或基于商业 LLM 的偏好标注。我们提出的奖励机制“后续似然作为奖励”(FLR),在 8 个成对偏好和 4 个基于评分的基准测试上,匹配了基于大规模人类或 GPT-4 标注数据训练的强奖励模型的性能。基于 FLR 机制,我们提出从基础策略模型的在线生成中自动挖掘偏好数据。这些偏好数据随后通过偏好直接对齐(DAP)方法(如直接偏好优化(DPO))用于提升基础模型的有用性。最后,我们证明,使用自然语言反馈对提供后续似然的语言模型进行微调,可显著增强 FLR 在奖励建模基准测试上的性能,以及在提升基础策略模型有用性方面的有效性。
引用
@article{arxiv.2409.13948,
title = {Aligning Language Models Using Follow-up Likelihood as Reward Signal},
author = {Chen Zhang and Dading Chong and Feng Jiang and Chengguang Tang and Anningzhe Gao and Guohua Tang and Haizhou Li},
journal= {arXiv preprint arXiv:2409.13948},
year = {2025}
}
备注
Accepted by AAAI-2025, 16 pages, reward model, LLM Alignment, code repository at (https://github.com/e0397123/FLR)