中文

低资源场景下自然语言处理近期方法综述

计算与语言 2021-04-12 v3 机器学习

摘要

深度神经网络与大型语言模型在自然语言应用中日益普及。鉴于其以需要大量训练数据著称,提升低资源场景性能的研究日渐增多。受近期向神经模型的根本转变及流行的预训练—微调范式推动,我们综述了低资源自然语言处理的有前景方法。在讨论数据可用性的不同维度后,我们给出在训练数据稀疏时赋能学习的方法的结构化概览。这包括创建额外标注数据的机制(如数据增强与远程监督)以及减少目标监督需求的迁移学习设置。本综述的一个目标是阐释这些方法在需求上的差异,因为理解这些对选择适合特定低资源场景的技术至关重要。本工作的其他关键方面是凸显开放问题并勾勒未来研究的有前景方向。

关键词

引用

@article{arxiv.2010.12309,
  title  = {A Survey on Recent Approaches for Natural Language Processing in Low-Resource Scenarios},
  author = {Michael A. Hedderich and Lukas Lange and Heike Adel and Jannik Strötgen and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2010.12309},
  year   = {2021}
}

备注

Accepted at NAACL 2021