基于梯度中多样性与不确定性的序列标注深度主动学习
计算与语言
2020-11-30 v1 人工智能
机器学习
摘要
近来,若干研究探讨了用于自然语言处理任务的主动学习(AL)以缓解数据依赖。然而,对于查询选择,这些研究大多依赖基于不确定性的采样,通常未利用未标注数据的结构信息。这导致批量主动学习设定下(一次选择多个样本)的采样偏差。在本工作中,我们证明在序列标注任务中,当主动学习同时结合不确定性与多样性时,可减少所需标注训练数据量。我们通过跨多个任务、数据集和模型在梯度嵌入方法中选取加权多样性样本,检验了基于序列的方法的效果,并持续优于经典的基于不确定性的采样和基于多样性的采样。
引用
@article{arxiv.2011.13570,
title = {Deep Active Learning for Sequence Labeling Based on Diversity and Uncertainty in Gradient},
author = {Yekyung Kim},
journal= {arXiv preprint arXiv:2011.13570},
year = {2020}
}