中文

用双动量对比对齐跨语言句子表示

计算与语言 2021-09-02 v1 信息检索

摘要

在本文中,我们提出将不同语言的句子表示对齐到统一嵌入空间中,其中语义相似度(跨语言与单语言)可用简单点积计算。预训练语言模型通过翻译排序任务进行微调。已有工作(Feng et al., 2020)使用同批次内句子作为负样本,这可能受易负样本问题困扰。我们适配 MoCo(He et al., 2020)以进一步提升对齐质量。如实验结果显示,我们的模型产生的句子表示在若干任务上达到新的最先进水平,包括 Tatoeba en-zh 相似度搜索(Artetxe and Schwenk, 2019b)、BUCC en-zh 双文本挖掘,以及 7 个数据集上的语义文本相似度。

关键词

引用

@article{arxiv.2109.00253,
  title  = {Aligning Cross-lingual Sentence Representations with Dual Momentum Contrast},
  author = {Liang Wang and Wei Zhao and Jingming Liu},
  journal= {arXiv preprint arXiv:2109.00253},
  year   = {2021}
}

备注

Accepted to EMNLP 2021 main conference