中文

从掩码语言建模到翻译:非英语辅助任务改善零样本口语语言理解

计算与语言 2021-05-18 v1

摘要

低资源语言公开可用评估数据的缺乏限制了口语语言理解(SLU)的进展。由于意图分类和槽填充等关键任务需要丰富的训练数据,期望重用高资源语言中的现有数据来为低资源场景开发模型。我们引入xSID,一个用于13种来自6个语系的跨语言槽与意图检测的新基准,包括一种极低资源方言。为应对该挑战,我们提出一种联合学习方法,利用英语SLU训练数据以及来自原始文本、句法和翻译的非英语辅助任务进行迁移。我们研究了两种在预训练嵌入类型和语言覆盖上不同的设置。我们的结果表明,将主任务与掩码语言建模联合学习对槽填充有效,而机器翻译迁移对意图分类效果最佳。

关键词

引用

@article{arxiv.2105.07316,
  title  = {From Masked Language Modeling to Translation: Non-English Auxiliary Tasks Improve Zero-shot Spoken Language Understanding},
  author = {Rob van der Goot and Ibrahim Sharaf and Aizhan Imankulova and Ahmet Üstün and Marija Stepanović and Alan Ramponi and Siti Oryza Khairunnisa and Mamoru Komachi and Barbara Plank},
  journal= {arXiv preprint arXiv:2105.07316},
  year   = {2021}
}

备注

To appear in the proceedings of NAACL 2021