超越样本级反馈:使用参考级反馈指导数据合成
计算与语言
2025-10-14 v3
摘要
高质量的指令微调数据对于开发能够有效处理现实世界任务并遵循人类指令的大语言模型 (LLMs) 至关重要。尽管合成数据生成为创建此类数据集提供了可扩展的途径,但它设定了一个质量上限,即基于该数据训练的模型无法超越生成它的 LLM。为克服这一局限,我们引入了参考级反馈,这是一种从精心挑选的参考样本中提取理想特征以指导合成更高质量指令-响应对的范式。利用该方法,我们合成了 REFED,一个包含 1 万条指令-响应对的数据集。在 REFED 上对 Llama-3.1-8B-Instruct 和 Mistral-7B-Instruct 进行微调,在同等规模模型中展现出最先进的性能,特别是在 AlpacaEval 2.0 上达到了 43.96% 的长度控制胜率。大量实验表明,参考级反馈始终优于传统的样本级反馈方法,可跨模型架构泛化,并以低成本生成高质量和多样化的数据。
引用
@article{arxiv.2502.04511,
title = {Beyond Sample-Level Feedback: Using Reference-Level Feedback to Guide Data Synthesis},
author = {Shuhaib Mehri and Xiusi Chen and Heng Ji and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2502.04511},
year = {2025}
}