中文

面向零样本跨语言意图预测与槽填充的多语码切换方法

计算与语言 2021-03-17 v2 机器学习

摘要

预测用户意图并检测文本中相应槽位是自然语言理解(NLU)中的两个关键问题。在零样本学习背景下,该任务通常要么利用mBERT等预训练多语言transformers的表示,要么将源数据机器翻译为已知目标语言再微调。我们的工作聚焦于训练时目标语言未知的特定场景。为此,我们提出一种新方法,通过随机翻译的多语码切换来增强单语源数据,从而在为下游任务微调时增强transformer的语言中立性。该方法还有助于发现关于全球不同语系的码切换如何影响目标语言性能的新见解。在MultiATIS++基准数据集上的实验表明,相较最先进方法,我们的方法在8种不同语言上的意图任务准确率平均提升+4.2%,槽任务F1平均提升+1.8%。此外,我们展示了将该方法应用于危机信息学,使用一个新的英文与海地克里奥尔语槽填充人工标注推文数据集,该数据集采集于海地地震灾害期间。

关键词

引用

@article{arxiv.2103.07792,
  title  = {Multilingual Code-Switching for Zero-Shot Cross-Lingual Intent Prediction and Slot Filling},
  author = {Jitin Krishnan and Antonios Anastasopoulos and Hemant Purohit and Huzefa Rangwala},
  journal= {arXiv preprint arXiv:2103.07792},
  year   = {2021}
}