中文

神经机器翻译中词与字符向量表示的结合

计算与语言 2020-09-15 v1

摘要

本文描述了英印尼语神经机器翻译(NMT)中词向量表示与字符向量表示的结合。构建了六种具有不同输入向量表示的 NMT 模型:基于词、使用双向 LSTM(bi-LSTM)的词与字符表示结合、使用 CNN 的词与字符表示结合、通过三种不同向量运算(加法、逐点乘法与平均)结合 bi-LSTM 与 CNN 的词与字符表示结合。实验结果表明,除采用 bi-LSTM 与 CNN 加法结合的词与字符表示模型外,所有结合词与字符表示的模型其 BLEU 分数均高于基线模型,高出 9.14 至 11.65 分。最高 BLEU 分数达 42.48,而基线模型为 30.83。

关键词

引用

@article{arxiv.2009.05935,
  title  = {Combining Word and Character Vector Representation on Neural Machine Translation},
  author = {K. M. Shahih and Ayu Purwarianti},
  journal= {arXiv preprint arXiv:2009.05935},
  year   = {2020}
}

备注

5 pages, 5 figures. Published in 2019 Fourth International Conference on Informatics and Computing (ICIC)