神经机器翻译中词与字符向量表示的结合
计算与语言
2020-09-15 v1
摘要
本文描述了英印尼语神经机器翻译(NMT)中词向量表示与字符向量表示的结合。构建了六种具有不同输入向量表示的 NMT 模型:基于词、使用双向 LSTM(bi-LSTM)的词与字符表示结合、使用 CNN 的词与字符表示结合、通过三种不同向量运算(加法、逐点乘法与平均)结合 bi-LSTM 与 CNN 的词与字符表示结合。实验结果表明,除采用 bi-LSTM 与 CNN 加法结合的词与字符表示模型外,所有结合词与字符表示的模型其 BLEU 分数均高于基线模型,高出 9.14 至 11.65 分。最高 BLEU 分数达 42.48,而基线模型为 30.83。
引用
@article{arxiv.2009.05935,
title = {Combining Word and Character Vector Representation on Neural Machine Translation},
author = {K. M. Shahih and Ayu Purwarianti},
journal= {arXiv preprint arXiv:2009.05935},
year = {2020}
}
备注
5 pages, 5 figures. Published in 2019 Fourth International Conference on Informatics and Computing (ICIC)