中文

VECO 2.0:基于多粒度对比学习的跨语言语言模型预训练

计算与语言 2023-04-18 v1

摘要

近期研究已证明通过为多种语言训练统一的Transformer编码器,跨语言可迁移性具有潜力。除采用掩码语言模型目标外,现有跨语言预训练工作利用句子级对比学习或插入额外的跨注意力模块,以弥补跨语言对齐能力的不足。然而,双语语料中存在的同义词组未被利用与对齐,而对于词元级任务而言,这比建立句子相互依赖更为关键。本工作中,我们提出基于多粒度对齐对比学习的跨语言预训练模型VECO 2.0。具体而言,引入序列到序列对齐以最大化平行句对的相似度并最小化非平行句对。随后,整合词元到词元对齐,以通过双语实例中源于同义词词典的同义词元,在其他未配对词元间弥合鸿沟。实验在XTREME基准上展示了所提跨语言模型预训练策略的有效性。

关键词

引用

@article{arxiv.2304.08205,
  title  = {VECO 2.0: Cross-lingual Language Model Pre-training with Multi-granularity Contrastive Learning},
  author = {Zhen-Ru Zhang and Chuanqi Tan and Songfang Huang and Fei Huang},
  journal= {arXiv preprint arXiv:2304.08205},
  year   = {2023}
}

备注

Technical Report for AliceMind's VECO 2.0 (ranked 1st on the XTREME leaderboard on March 17, 2023)