作为零样本多语言翻译的复述生成:解耦语义相似性与词汇及句法多样性
计算与语言
2020-10-29 v2
摘要
近期工作表明,多语言神经机器翻译(NMT)模型可用于判断同一语言中一个句子对另一个句子的复述程度(Thompson 和 Post,2020);然而,试图通过标准束搜索从此类模型生成复述会产生平凡的复制或近似复制。我们引入一种简单的复述生成算法,其抑制生成输入中存在的 n-gram。我们的方法能从单一多语言 NMT 模型生成多种语言的复述。此外,输入与输出之间的词汇多样性程度可在生成时控制。我们进行人工评估,将我们的方法与在大型英文合成复述数据库 ParaBank 2(Hu 等人,2019c)上训练的复述器比较,发现在相同词汇多样性水平下,我们的方法生成的复述更好地保留语义且更合乎语法。额外的小型人工评估表明我们的方法也适用于两种非英语语言。
引用
@article{arxiv.2008.04935,
title = {Paraphrase Generation as Zero-Shot Multilingual Translation: Disentangling Semantic Similarity from Lexical and Syntactic Diversity},
author = {Brian Thompson and Matt Post},
journal= {arXiv preprint arXiv:2008.04935},
year = {2020}
}
备注
WMT2020