中文

VirAAL:面向自然语言理解的虚拟对抗主动学习

计算与语言 2021-10-27 v2

摘要

本文提出VirAAL,一种基于对抗训练的主动学习框架。VirAAL旨在减少自然语言理解(NLU)中的标注工作量。VirAAL基于虚拟对抗训练(VAT),一种通过局部分布平滑正则化模型的半监督方法。据此,将对抗扰动加入输入使后验分布更为一致。因此,基于熵的主动学习通过查询更具信息量的样本而变得鲁棒,且无需额外组件。第一组实验研究了在低标注数据体制下适配的VAT对联合NLU任务的影响。第二组展示了VirAAL在主动学习(AL)过程中的效果。结果表明VAT即使在多任务训练下也具鲁棒性,其中对抗噪声由多个损失函数计算。采用VirAAL基于熵的AL查询标注数据观察到显著改进。VirAAL在AL计算上是一种廉价方法,对数据采样有积极影响。此外,VirAAL在AL中将标注量减少多达80%,并显示出优于现有数据增强方法的改进。代码已公开可用。

关键词

引用

@article{arxiv.2005.07287,
  title  = {VirAAL: Virtual Adversarial Active Learning For NLU},
  author = {Gregory Senay and Badr Youbi Idrissi and Marine Haziza},
  journal= {arXiv preprint arXiv:2005.07287},
  year   = {2021}
}

备注

To appear in Proc. IEEE SLT 2021, January 19-22, 2021, Shenzhen, China