中文

基准中的所有数据集都必要吗?一项关于文本分类数据集评估的初步研究

计算与语言 2022-05-05 v1

摘要

本文提出研究问题:基准中的所有数据集是否都必要。我们首先通过刻画比较不同系统时数据集的可区分性来切入。在 9 个数据集与 36 个系统上的实验表明,若干现有基准数据集对区分高分系统贡献甚微,而那些较少被使用的数据集却展现出令人印象深刻的区分能力。我们进一步以文本分类任务为案例,探究基于数据集属性(如平均句长)预测其区分度的可能性。我们的初步实验可喜地显示,给定足够数量的训练实验记录,可学到有意义的预测器来估计未见数据集的区分度。我们在 DataLab 上发布了本工作中探索的所有带特征的数据集:\url{https://datalab.nlpedia.ai}。

关键词

引用

@article{arxiv.2205.02129,
  title  = {Are All the Datasets in Benchmark Necessary? A Pilot Study of Dataset Evaluation for Text Classification},
  author = {Yang Xiao and Jinlan Fu and See-Kiong Ng and Pengfei Liu},
  journal= {arXiv preprint arXiv:2205.02129},
  year   = {2022}
}

备注

9 pages, 9 figures