中文

WALNUT:面向自然语言理解的半弱监督学习基准

计算与语言 2022-05-24 v3 机器学习

摘要

为自然语言理解(NLU)任务构建机器学习模型严重依赖标注数据。当大量标注数据不可用或获取成本高昂时,弱监督已被证明具有价值。现有研究弱监督用于NLU的工作要么大多聚焦于特定任务,要么从真实标签模拟弱监督信号。因此,在没有统一且系统的、具有多样任务和真实世界弱标注规则的基准的情况下,很难比较不同方法并评估弱监督的益处。在本文中,我们提出这样一个基准,名为WALNUT(面向自然语言理解的半弱监督学习测试床,semi-WeAkly supervised Learning for Natural language Understanding Testbed),以倡导并促进NLU弱监督研究。WALNUT包含不同类型的NLU任务,包括文档级和词元级预测任务。WALNUT是首个面向NLU的半弱监督学习基准,其中每个任务包含由多个真实世界弱源生成的弱标签,以及一小部分干净标签。我们在WALNUT上进行基线评估,以系统评价各种弱监督方法和模型架构的有效性。我们的结果证明了弱监督对低资源NLU任务的益处,并突出了跨任务的有趣模式。我们期望WALNUT能激发关于更有效利用弱监督的方法论的进一步研究。基准和基线代码可在\url{aka.ms/walnut_benchmark}获取。

关键词

引用

@article{arxiv.2108.12603,
  title  = {WALNUT: A Benchmark on Semi-weakly Supervised Learning for Natural Language Understanding},
  author = {Guoqing Zheng and Giannis Karamanolakis and Kai Shu and Ahmed Hassan Awadallah},
  journal= {arXiv preprint arXiv:2108.12603},
  year   = {2022}
}

备注

Accepted to NAACL 2022 (Long Paper)