NMTScore:基于翻译的文本相似度度量的多语言分析
计算与语言
2022-10-20 v2
摘要
能够对短文本段的相似性进行排序,是神经机器翻译的一项有趣附加功能。基于翻译的相似度度量包括直接与枢轴翻译概率,以及迄今尚未被研究的翻译交叉似然。我们在多语言NMT的共同框架下分析这些度量,并发布NMTScore库(可在https://github.com/ZurichNLP/nmtscore获取)。与句子嵌入等基线相比,基于翻译的度量在释义识别中具有竞争力,并且对对抗性或多语言输入更鲁棒,尤其在应用适当归一化的情况下。当用于2个任务和17种语言下数据到文本生成的基于参考的评测时,基于翻译的度量显示出与人类判断相对较高的相关性。
引用
@article{arxiv.2204.13692,
title = {NMTScore: A Multilingual Analysis of Translation-based Text Similarity Measures},
author = {Jannis Vamvas and Rico Sennrich},
journal= {arXiv preprint arXiv:2204.13692},
year = {2022}
}
备注
Findings of EMNLP 2022