中文

无未标注数据且采用朴素增强的无监督数据增强

计算与语言 2020-10-26 v1 机器学习

摘要

无监督数据增强(UDA)是一种半监督技术,它施加一致性损失以惩罚模型在以下两者预测之间的差异:(a) 观测到的(未标注)样本;以及 (b) 通过数据增强产生的相应“加噪”样本。尽管 UDA 已在文本分类中获得关注,但关于哪些设计决策是必要的,以及如何将该法扩展至序列标注任务,仍存在未解之谜。该方法近来在文本分类中颇受青睐。本文中,我们重新审视 UDA 并展示其在若干序列任务上的效力。我们的主要贡献是对 UDA 的实证研究,以确定算法中哪些组件为 NLP 带来增益。值得注意的是,尽管先前工作强调使用包括回译在内的巧妙增强技术,我们发现,强制观测词与随机替换词所赋预测之间的一致性,相较于这些复杂扰动模型常带来相当(甚至更大)的益处。此外,我们发现,即便完全没有任何未标注数据,即在标准监督设定下,施加其一贯性损失也能带来显著增益。简言之:UDA 不必是无监督的,且不需复杂数据增强即可有效。

关键词

引用

@article{arxiv.2010.11966,
  title  = {Unsupervised Data Augmentation with Naive Augmentation and without Unlabeled Data},
  author = {David Lowell and Brian E. Howard and Zachary C. Lipton and Byron C. Wallace},
  journal= {arXiv preprint arXiv:2010.11966},
  year   = {2020}
}