中文

论数据集内在少样本难度的度量

计算与语言 2022-11-17 v1

摘要

尽管预训练的进步带来了 NLP 任务少样本学习的显著改进,但对于是什么驱动了数据集中成功的少样本适配仍理解有限。特别地,给定一个新数据集和一个预训练模型,数据集的哪些属性使其可少样本学习,且这些属性是否独立于所使用的具体适配技术?我们考虑了一组广泛的近期少样本学习方法,并表明它们在大量数据集上的性能高度相关,说明对于给定的预训练模型,少样本难度可能是数据集固有的。为了估计内在少样本难度,我们随后提出了一种称为“Spread”的简单轻量指标,其捕捉了如下直觉:少样本学习是通过利用训练与测试样本间特征空间不变性而成为可能的。与现有的难度概念相比,我们的指标更好地解释了少样本难度,且计算速度快约 8-100 倍。

关键词

引用

@article{arxiv.2211.09113,
  title  = {On Measuring the Intrinsic Few-Shot Hardness of Datasets},
  author = {Xinran Zhao and Shikhar Murty and Christopher D. Manning},
  journal= {arXiv preprint arXiv:2211.09113},
  year   = {2022}
}

备注

EMNLP 2022 camera ready version