中文

Measuring Diversity in Synthetic Datasets

计算与语言 2025-08-15 v3 人工智能

摘要

大型语言模型(LLMs)被广泛用于为各种自然语言处理(NLP)任务(如文本分类和摘要)生成合成数据集。然而,准确衡量这些合成数据集的多样性——这对模型性能的鲁棒性至关重要——仍然是一个重大挑战。在本文中,我们引入了DCScore,一种从分类视角衡量合成数据集多样性的新方法。具体来说,DCScore将多样性评估形式化为一个样本分类任务,利用样本间的相互关系。我们进一步提供了DCScore所满足的多样性相关公理的理论验证,突显了其作为原则性多样性评估方法的作用。在合成数据集上的实验结果表明,DCScore与所评估数据集的多个多样性伪真实值具有更强的相关性,强调了其有效性。此外,经验和理论证据均表明,与现有方法相比,DCScore显著降低了计算成本。代码可在以下地址获取:https://github.com/bluewhalelab/dcscore。

关键词

引用

@article{arxiv.2502.08512,
  title  = {Measuring Diversity in Synthetic Datasets},
  author = {Yuchang Zhu and Huizhe Zhang and Bingzhe Wu and Jintang Li and Zibin Zheng and Peilin Zhao and Liang Chen and Yatao Bian},
  journal= {arXiv preprint arXiv:2502.08512},
  year   = {2025}
}

备注

Accepted by ICML 2025