基于跨语言一致性正则化的多语言句子表示学习
计算与语言
2023-06-13 v1 人工智能
摘要
多语言句子表示是基于相似度的双语文本挖掘的基础,而后者对于将多语言神经机器翻译(NMT)系统扩展到更多语言至关重要。本文中,我们引入MuSR:一个支持超过220种语言的“一统天下”的多语言句子表示模型。利用数十亿以英语为中心的平行语料,我们采用Gao等人(2023)提出的跨语言一致性正则化技术CrossConST,通过多语言NMT框架训练了一个多语言Transformer编码器,并辅以一个辅助Transformer解码器。在多语言相似度搜索与双语文本挖掘任务上的实验结果表明了我们方法的有效性。具体而言,MuSR优于由148个独立多语言句子编码器组成的LASER3 (Heffernan et al., 2022)。
引用
@article{arxiv.2306.06919,
title = {Learning Multilingual Sentence Representations with Cross-lingual Consistency Regularization},
author = {Pengzhi Gao and Liwen Zhang and Zhongjun He and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2306.06919},
year = {2023}
}