中文

深度主动分类中的采样偏差:一项实证研究

计算与语言 2019-09-23 v1 机器学习

摘要

数据标注和模型训练所需的高昂成本与时间是训练大规模数据集上深度神经网络模型的瓶颈。利用主动学习等策略识别较小的代表性数据样本有助于缓解此类瓶颈。先前关于自然语言处理中主动学习的研究识别了基于不确定性查询所获取样本中的采样偏差问题,并开发了成本高昂的方法来解决它。通过一项大规模实证研究,我们证明,使用深度模型(如FastText.zip (FTZ))的后验熵进行主动集选择对采样偏差和各种算法选择(查询规模和策略)具有鲁棒性,这与传统文献所建议的不同。我们还表明,基于FTZ的查询策略产生的样本集与更复杂方法(如集成网络)产生的样本集相似。最后,我们通过创建微小的高质量数据集并将其用于大型模型的快速廉价训练,展示了所选样本的有效性。基于上述发现,我们为深度主动文本分类提出了一个简单的基线,其性能优于当前最优方法。我们期望所呈现的工作对数据集压缩以及涉及主动、半监督或在线学习场景的问题有用且具有启发性。代码和模型可在以下地址获取:https://github.com/drimpossible/Sampling-Bias-Active-Learning

关键词

引用

@article{arxiv.1909.09389,
  title  = {Sampling Bias in Deep Active Classification: An Empirical Study},
  author = {Ameya Prabhu and Charles Dognin and Maneesh Singh},
  journal= {arXiv preprint arXiv:1909.09389},
  year   = {2019}
}

备注

Accepted at EMNLP 2019