CrowdSelect:基于多 LLM 智慧的合成指令数据选择
计算与语言
2025-03-04 v1 人工智能
摘要
通过选取子集来蒸馏先进大语言模型的指令遵循能力到小模型已成为模型训练的主流方法。虽然现有的合成指令数据选择策略主要依赖单一维度信号(即奖励得分、模型困惑度),但它们未能捕捉指令遵循在不同领域中的复杂性。因此,我们调查更丰富的信号以全面捕捉指令-响应对的特征,提出三项基础指标,利用多 LLM 智慧,依据(1)多样化的 LLM 响应和(2)奖励模型评估。基于基础指标,我们提出 CrowdSelect,一种集成指标,结合基于聚类的方法以保持响应的多样性。我们的全面实验表明,基础指标在 4 个基础模型上在 MT-bench 和 Arena-Hard 上均能持续改进性能。CrowdSelect 高效地整合了所有指标,在 Full 和 LoRA 微调中均实现最先进的性能,分别在 Arena-Hard 上提升 4.81%,在 MT-bench 上提升 11.1%。我们希望我们的发现将为未来研究的这一方向带来有价值的见解。代码请参见 https://github.com/listentm/crowdselect。
引用
@article{arxiv.2503.01836,
title = {CrowdSelect: Synthetic Instruction Data Selection with Multi-LLM Wisdom},
author = {Yisen Li and Lingfeng Yang and Wenxuan Shen and Pan Zhou and Yao Wan and Weiwei Lin and Dongping Chen},
journal= {arXiv preprint arXiv:2503.01836},
year = {2025}
}