中文

N 元语法最近邻机器翻译

计算与语言 2023-02-08 v2 机器学习

摘要

最近邻机器翻译通过 kk 近邻检索增强自回归翻译(AT),比较查询中目标词元的词级上下文表示与数据存储中的相似度。然而,词级表示在翻译歧义词时可能引入噪声,或当模型生成的表示包含不可区分的上下文信息(如非自回归翻译(NAT)模型)时无法提供准确检索结果。本文中,我们提出一种模型无关且适用于 AT 与 NAT 模型的新型 nn 元语法最近邻检索方法。具体而言,我们将相邻的 nn 元语法隐藏表示拼接作为键,而相应目标词元元组为值。推理时,我们分别提出针对 AT 与 NAT 模型的定制解码算法。我们表明所提方法在 AT 与 NAT 模型上及通用与领域自适应翻译任务上均一致优于词级方法。在领域自适应上,所提方法在 AT 与 NAT 模型上分别带来平均 BLEU 分数 1.031.032.762.76 的提升。

关键词

引用

@article{arxiv.2301.12866,
  title  = {N-Gram Nearest Neighbor Machine Translation},
  author = {Rui Lv and Junliang Guo and Rui Wang and Xu Tan and Qi Liu and Tao Qin},
  journal= {arXiv preprint arXiv:2301.12866},
  year   = {2023}
}