利用合成偏好数据的自提升大语言模型
计算与语言
2024-10-10 v1 人工智能
摘要
通过与人类偏好相匹配,大语言模型 (LLM) 在生成诚实、无害且有帮助的响应方面取得了显著进展。然而,收集高质量的偏好数据对 LLM 的持续改进具有资源密集且需要创造力的特点。我们提出 SynPO,一种自提升范式,利用合成偏好数据进行模型对齐。SynPO 采用迭代机制,其中自提示生成器创建多样化提示,response improver 不断完善模型响应。该方法使 LLM 能够自主学习其自身输出的生成奖励,消除了对大规模提示和人类偏好注释的需求。在完成四轮 SynPO 迭代后,Llama3-8B 和 Mistral-7B 在指令遵循能力方面实现了显著提升,在 AlpacaEval 2.0 和 ArenaHard 上分别实现了超过 22.1% 的获胜率提升。同时,SynPO 也提升了 LLM 在各种任务上的通用性能,通过在广为人知的 Open LLM 排行榜上实现 3.2 到 5.0 的平均得分提升进行验证。
引用
@article{arxiv.2410.06961,
title = {Self-Boosting Large Language Models with Synthetic Preference Data},
author = {Qingxiu Dong and Li Dong and Xingxing Zhang and Zhifang Sui and Furu Wei},
journal= {arXiv preprint arXiv:2410.06961},
year = {2024}
}