通过学习语言反馈提升语言模型自我改进能力
计算与语言
2024-06-12 v1
摘要
与人类意图和价值观对齐是大语言模型(LLM)面临的关键挑战。当前方法主要依赖人类偏好,但成本高昂且不足以捕捉以自然语言表达的细腻反馈。本文提出自我精炼调优(Self-Refinement Tuning, SRT),通过模型反馈实现对齐,从而减少对人类标注的依赖。SRT 使用基础语言模型(如 Tulu2)生成初始响应,由更高级模型(如 GPT-4-Turbo)进行批评和精炼,该过程使基础模型能够自评估并改进其输出,实现持续学习。SRT 进一步通过学习自生成的反馈和精炼结果进行优化,形成反馈回路以促进模型改进。我们的实证评估表明,SRT 在多样化任务和模型规模上均显著优于强大基线。应用于70亿参数模型时,SRT 在 AlpacaEval 2.0 benchmark 上获胜率从 9.6% 提升至 25.8%,超越 GPT-4-0314、Claude 2 和 Gemini 等成熟系统。我们的分析突显了语言反馈在 SRT 成功中的关键作用,指向了该方向的进一步探索潜力。
引用
@article{arxiv.2406.07168,
title = {Teaching Language Models to Self-Improve by Learning from Language Feedback},
author = {Chi Hu and Yimin Hu and Hang Cao and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2406.07168},
year = {2024}
}
备注
Findings of ACL 2024