中文

用于神经机器翻译的基于词的领域自适应

计算与语言 2019-06-10 v1 人工智能

摘要

本文通过实证考察应用词级权重将神经机器翻译适配到电子商务领域,其中可获取小型电商数据集与大型域外数据集。为了在域外数据集中挖掘类域内词,我们使用一个领域特定语言模型与一个非领域特定语言模型计算词权重,随后进行平滑与二值量化。基线模型在混合的域内与域外数据集上训练。英到中电商领域翻译的实验结果表明,与不使用词权重的继续训练相比,该方法将机器翻译质量绝对提升了至多 2.11% BLEU 与 1.59% TER。我们也使用在域内数据上的微调训练了模型。以词权重进行预训练可将微调分别绝对提升至多 1.24% BLEU 与 1.64% TER。

关键词

引用

@article{arxiv.1906.03129,
  title  = {Word-based Domain Adaptation for Neural Machine Translation},
  author = {Shen Yan and Leonard Dahlmann and Pavel Petrushkov and Sanjika Hewavitharana and Shahram Khadivi},
  journal= {arXiv preprint arXiv:1906.03129},
  year   = {2019}
}

备注

Published on the proceedings of the International Workshop on Spoken Language Translation (IWSLT), 2018