中文

以多样性作为奖励:对域未确定数据进行 LLM 精调

计算与语言 2025-10-31 v3 人工智能 机器学习

摘要

使用多样化数据集对大型语言模型(LLM)进行精调对于提升其在 various 领域的整体性能至关重要。在实际场景中,现有方法基于数据组成的混合比例建模常在数据缺少域标签、标签不精确或非标准化的情况下难以处理,而基于数据选择的方法则在平衡多域性能方面常遇到困难。为了应对这些挑战,本文通过实证构建对比数据池并理论推导解释,探讨数据多样性在提升 LLM 整体能力中的作用。基于所获得的见解,我们提出了一种新方法,赋予 LLM 双重身份:一种输出模型用于认知探索和基于多样性奖励选择数据,另一种输入模型用于所选数据进行精调。广泛的实验表明,所提方法在应用于 various 先进 LLM 时,可显著提升域未确定数据以及一系列基础下游任务上的性能。我们发布了代码,希望本研究能为理解数据多样性并推动面向 LLM 的反馈驱动数据-模型协同设计做出贡献。

关键词

引用

@article{arxiv.2502.04380,
  title  = {Diversity as a Reward: Fine-Tuning LLMs on a Mixture of Domain-Undetermined Data},
  author = {Zhenqing Ling and Daoyuan Chen and Liuyi Yao and Qianli Shen and Yaliang Li and Ying Shen},
  journal= {arXiv preprint arXiv:2502.04380},
  year   = {2025}
}

备注

Accepted by NeurIPS'25 main track. 47 pages, 21 figures, 32 tables