中文

从多个含噪增广数据集学习以提升跨语言口语语言理解

计算与语言 2021-09-06 v1 人工智能

摘要

训练数据的缺乏对将口语语言理解(SLU)扩展到低资源语言构成了巨大挑战。尽管已提出多种数据增广方法以在低资源目标语言中合成训练数据,但增广数据集往往含噪,从而妨碍了 SLU 模型的性能。在本文中,我们专注于减轻增广数据中的噪声。我们开发了一种去噪训练方法。多个模型用各种增广方法产生的数据进行训练。这些模型相互提供监督信号。实验结果表明,我们的方法在两个基准数据集上分别比现有最优(state of the art)高出 3.05 和 4.24 个百分点。代码将在 github 上开源。

关键词

引用

@article{arxiv.2109.01583,
  title  = {Learning from Multiple Noisy Augmented Data Sets for Better Cross-Lingual Spoken Language Understanding},
  author = {Yingmei Guo and Linjun Shou and Jian Pei and Ming Gong and Mingxing Xu and Zhiyong Wu and Daxin Jiang},
  journal= {arXiv preprint arXiv:2109.01583},
  year   = {2021}
}

备注

Long paper at EMNLP 2021