中文

论自适应数据收集对极度不平衡成对任务的重要性

计算与语言 2020-10-13 v1 机器学习

摘要

许多成对分类任务,如复述检测和开放域问答,天然具有极端的标签不平衡(例如,99.99%99.99\%的样本为负例)。相比之下,许多近期数据集通过启发式方法挑选样本以确保标签平衡。我们表明这些启发式方法导致训练模型泛化能力差:在QQP和WikiQA上训练的最先进模型在现实不平衡测试数据上平均精度分别仅有2.4%2.4\%。我们转而采用主动学习收集训练数据,使用基于BERT的嵌入模型从海量无标签话语对池中高效检索不确定样本。通过构建具有信息量更丰富负例的平衡训练数据,主动学习将QQP上的平均精度大幅提升至32.5%32.5\%,WikiQA上提升至20.1%20.1\%

关键词

引用

@article{arxiv.2010.05103,
  title  = {On the Importance of Adaptive Data Collection for Extremely Imbalanced Pairwise Tasks},
  author = {Stephen Mussmann and Robin Jia and Percy Liang},
  journal= {arXiv preprint arXiv:2010.05103},
  year   = {2020}
}

备注

In Findings of EMNLP 2020