Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection
计算与语言
2025-10-23 v1 人工智能
摘要
高质量的预训练数据对大型语言模型至关重要,其中质量涵盖事实可靠性和语义价值,多样性确保广泛覆盖和分布异质性。现有方法通常依赖单一或多维评分依据的选择,但直接选择高评分数据往往会损害性能,需要从更广泛的范围中进行抽样来恢复效果。数据评分与下游基准结果之间的这种非单调性揭示了根本性偏差:基于评分的方法会压缩相关维度,导致高评分数据看似高质量,却系统性地忽略了多样性。我们认为,确保多样性需要将相关指标分解为正交特征维度,从而可以直接选择高评分数据。因此,我们提出了正交多样性感知选择 (ODiS) 算法,在数据选择过程中保持质量和多样性。首先,ODiS 从多个维度对数据进行评估,涵盖语言质量、知识质量和理解难度。随后通过主成分分析 (PCA) 对多维评分进行去相关,得到正交的评估维度。对于每个维度,训练一个基于 RoBERTa 的评分器来对数据进行回归,从而在大型语料库上实现可扩展的推断。最后,ODiS 通过在每个正交维度中选择高评分数据来构建训练数据集,从而确保质量和多样性。实证结果表明,ODiS 选取的数据在维度间重叠不足 2%,确认了维度之间的正交性。更重要的是,使用 ODiS 选取的数据训练的模型在下游基准测试中显著优于其他基线方法,凸显了针对大型语言模型正交性、多样性感知数据选择的必要性。
关键词
引用
@article{arxiv.2510.18909,
title = {Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection},
author = {Hongyi He and Xiao Liu and Zhenghao Lin and Mingni Tang and Yi Cheng and Jintao Wang and Wenjie Li and Peng Cheng and Yeyun Gong},
journal= {arXiv preprint arXiv:2510.18909},
year = {2025}
}