VECO:用于语言理解与生成的可变灵活跨语言预训练模型
计算与语言
2021-06-03 v2
摘要
多语言预训练已有工作通过训练统一的Transformer编码器用于多种语言,展示了跨语言迁移的潜力。然而,这类工作大多仅依赖共享词表与双语上下文来鼓励跨语言关联,这对于对齐语言间的上下文表示而言是松散且隐式的。本文在Transformer编码器中插入一个交叉注意力模块,以显式地建立语言间的相互依赖。它能有效避免仅以自身语言上下文为条件预测掩码词的退化问题。更重要的是,在下游任务微调时,交叉注意力模块可按需插入或移除,从而自然惠及从语言理解到生成的更广泛跨语言任务。结果表明,所提跨语言模型在XTREME基准的各项跨语言理解任务(涵盖文本分类、序列标注、问答和句子检索)上取得了新的最先进结果。对于跨语言生成任务,它在WMT14英德和英法翻译数据集上也优于所有现有跨语言模型及最先进Transformer变体,提升达1~2 BLEU。
引用
@article{arxiv.2010.16046,
title = {VECO: Variable and Flexible Cross-lingual Pre-training for Language Understanding and Generation},
author = {Fuli Luo and Wei Wang and Jiahao Liu and Yijia Liu and Bin Bi and Songfang Huang and Fei Huang and Luo Si},
journal= {arXiv preprint arXiv:2010.16046},
year = {2021}
}
备注
Accepted by ACL 2021 (long paper)