中文

Domain2Vec: 无需训练即可向量化数据集以寻找最优数据混合

计算与语言 2025-06-13 v1 人工智能 机器学习

摘要

我们提出了Domain2Vec,一种将任意数据集分解为若干元域(meta-domains)线性组合的新方法,元域是一种旨在捕捉数据集关键底层特征的新概念。Domain2Vec维护一个元域词汇表,并使用分类器将任意给定数据集分解为一个域向量,该向量对应于该词汇表上的分布。这些域向量使得在无需训练的情况下,根据分布对齐假设(DA²)识别语言模型(LM)预训练的最优数据混合成为可能,该假设表明当训练集和验证集的数据分布更好地对齐时,可以实现更低的验证损失。此外,Domain2Vec可以无缝集成到先前工作中,以建模域向量与LM性能之间的关系,极大地提升了先前方法的效率和可扩展性。大量实验表明,Domain2Vec有助于找到能够以最小计算开销提升下游任务性能的数据混合。具体而言,Domain2Vec在Pile-CC上仅使用原始The Pile数据集混合所需计算量的51.5%即可达到相同的验证损失。在等效计算预算下,Domain2Vec将下游性能平均提升了2.83%。

关键词

引用

@article{arxiv.2506.10952,
  title  = {Domain2Vec: Vectorizing Datasets to Find the Optimal Data Mixture without Training},
  author = {Mozhi Zhang and Howe Tissue and Lu Wang and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2506.10952},
  year   = {2025}
}

备注

Accepted to ICML2025