CoSDA-ML:用于零样本跨语言NLP的多语言语码转换数据增强
计算与语言
2020-07-14 v2
摘要
多语言上下文嵌入,如multilingual-BERT (mBERT),已在多种零样本跨语言任务中展现出成功。然而,这些模型受限于不同语言中子词的上下文表示不一致。现有工作通过双语投影和微调技术解决该问题。我们提出一个数据增强框架来生成多语言语码转换数据以微调mBERT,其通过混合源语言与多种目标语言的上下文信息,鼓励模型一次性对齐它们的表示。与现有工作相比,我们的方法不依赖双语句子进行训练,且仅需一次训练过程即可面向多种目标语言。在5项任务、19种语言上的实验结果表明,与mBERT相比,我们的方法使所有任务的性能均得到显著提升。
引用
@article{arxiv.2006.06402,
title = {CoSDA-ML: Multi-Lingual Code-Switching Data Augmentation for Zero-Shot Cross-Lingual NLP},
author = {Libo Qin and Minheng Ni and Yue Zhang and Wanxiang Che},
journal= {arXiv preprint arXiv:2006.06402},
year = {2020}
}
备注
Accepted at IJCAI2020. SOLE copyright holder is IJCAI (international Joint Conferences on Artificial Intelligence), all rights reserved. http://static.ijcai.org/2020-accepted_papers.html