中文

knn-seq:高效、可扩展的kNN-MT框架

计算与语言 2023-10-20 v1

摘要

k近邻机器翻译(kNN-MT)通过在解码过程中利用翻译样例来提升预训练神经机器翻译(NMT)模型的翻译质量。翻译样例存储于称为数据存储(datastore)的向量数据库中,其中包含其构建所用平行数据中每个目标词元的一个条目。由于其规模,构建数据存储及从中检索样例在计算上均十分昂贵。本文中,我们为研究人员与开发者提出一个高效且可扩展的kNN-MT框架knn-seq,其经过精心设计可高效运行,即便面对十亿规模的大型数据存储。knn-seq作为fairseq上的插件开发,易于切换模型与kNN索引。实验结果表明,我们实现的kNN-MT取得了与原始kNN-MT相当的增益,且在WMT'19德英翻译任务中,十亿规模数据存储的构建耗时2.21小时。我们将knn-seq以MIT许可的开源项目发布,代码见于https://github.com/naist-nlp/knn-seq。演示视频见于https://youtu.be/zTDzEOq80m0。

关键词

引用

@article{arxiv.2310.12352,
  title  = {knn-seq: Efficient, Extensible kNN-MT Framework},
  author = {Hiroyuki Deguchi and Hayate Hirano and Tomoki Hoshino and Yuto Nishida and Justin Vasselli and Taro Watanabe},
  journal= {arXiv preprint arXiv:2310.12352},
  year   = {2023}
}