中文

NMTScore:基于翻译的文本相似度度量的多语言分析

计算与语言 2022-10-20 v2

摘要

能够对短文本段的相似性进行排序,是神经机器翻译的一项有趣附加功能。基于翻译的相似度度量包括直接与枢轴翻译概率,以及迄今尚未被研究的翻译交叉似然。我们在多语言NMT的共同框架下分析这些度量,并发布NMTScore库(可在https://github.com/ZurichNLP/nmtscore获取)。与句子嵌入等基线相比,基于翻译的度量在释义识别中具有竞争力,并且对对抗性或多语言输入更鲁棒,尤其在应用适当归一化的情况下。当用于2个任务和17种语言下数据到文本生成的基于参考的评测时,基于翻译的度量显示出与人类判断相对较高的相关性。

关键词

引用

@article{arxiv.2204.13692,
  title  = {NMTScore: A Multilingual Analysis of Translation-based Text Similarity Measures},
  author = {Jannis Vamvas and Rico Sennrich},
  journal= {arXiv preprint arXiv:2204.13692},
  year   = {2022}
}

备注

Findings of EMNLP 2022