Refine-n-Judge:用于LLM微调的高质量偏好链精选
人工智能
2025-10-31 v2
摘要
大型语言模型(LLM)通过基于偏好的微调已取得显著进展,这关键取决于底层训练数据的质量。虽然人类反馈对提高数据质量至关重要,但其成本高昂且难以规模化。在本文中,我们介绍了Refine-n-Judge,这是一种自动化迭代方法,利用单个LLM同时作为精炼者和裁判来增强数据集质量。不同于现有迭代精炼方法,Refine-n-Judge采用LLM既生成精炼方案又显式评估每项改进,确保每个迭代都有意义地提高数据集,而无需额外的人类标注或单独的奖励模型。在每一步中,LLM精炼一个响应并判断该精炼是否优于上一个答案。该过程持续到LLM偏好初始答案优于精炼结果为止,表明不再需要进一步的改进。这产生一系列质量逐步提升的、带偏好标签的响应,适合微调。我们在多个公开数据集上展示了Refine-n-Judge的有效性,覆盖五个语料库,针对任务包括编程、数学和对话。在Refine-n-Judge增强的数据集上微调的模型(Llama 3.1-8B和Llama 3.3-70B),在与在原始数据集上由GPT-4微调的模型进行比较时,被LLM裁判偏好超过74%。此外,我们报告了性能提升:在AlpacaEval和AlpacaEval 2.0上提升5%,在MT-Bench上提升19%。我们的结果表明,Refine-n-Judge产生高质量数据集并实现可扩展的模型改进。
引用
@article{arxiv.2508.01543,
title = {Refine-n-Judge: Curating High-Quality Preference Chains for LLM-Fine-Tuning},
author = {Derin Cayir and Renjie Tao and Rashi Rungta and Kai Sun and Sean Chen and Haidar Khan and Minseok Kim and Julia Reinspach and Yue Liu},
journal= {arXiv preprint arXiv:2508.01543},
year = {2025}
}