论自适应数据收集对极度不平衡成对任务的重要性
计算与语言
2020-10-13 v1 机器学习
摘要
许多成对分类任务,如复述检测和开放域问答,天然具有极端的标签不平衡(例如,的样本为负例)。相比之下,许多近期数据集通过启发式方法挑选样本以确保标签平衡。我们表明这些启发式方法导致训练模型泛化能力差:在QQP和WikiQA上训练的最先进模型在现实不平衡测试数据上平均精度分别仅有。我们转而采用主动学习收集训练数据,使用基于BERT的嵌入模型从海量无标签话语对池中高效检索不确定样本。通过构建具有信息量更丰富负例的平衡训练数据,主动学习将QQP上的平均精度大幅提升至,WikiQA上提升至。
引用
@article{arxiv.2010.05103,
title = {On the Importance of Adaptive Data Collection for Extremely Imbalanced Pairwise Tasks},
author = {Stephen Mussmann and Robin Jia and Percy Liang},
journal= {arXiv preprint arXiv:2010.05103},
year = {2020}
}
备注
In Findings of EMNLP 2020