用于神经机器翻译的基于词格的循环神经网络编码器
计算与语言
2016-12-12 v2
摘要
神经机器翻译 (NMT) 极度依赖词级建模来学习输入句子的语义表示。然而,对于没有自然词分隔符的语言(如中文),输入句子必须先进行分词,传统 NMT 面临两个问题:1) 难以为源语言句子建模找到最优的分词粒度;2) 1-best 分词中的错误可能会传播到 NMT 的编码器中。为了解决这些问题,我们提出了用于 NMT 的基于词格 (word lattice) 的循环神经网络 (RNN) 编码器,将标准 RNN 推广至词格拓扑结构。所提出的编码器将紧凑编码了多种分词结果的词格作为输入,并学习从前一时间步的任意多个输入和隐藏状态生成新的隐藏状态。因此,基于词格的编码器不仅减轻了分词错误的负面影响,而且在嵌入输入句子时更具表达力和灵活性。中文到英文翻译的实验结果证明了所提出编码器相对于传统编码器的优越性。
引用
@article{arxiv.1609.07730,
title = {Lattice-Based Recurrent Neural Network Encoders for Neural Machine Translation},
author = {Jinsong Su and Zhixing Tan and Deyi Xiong and Rongrong Ji and Xiaodong Shi and Yang Liu},
journal= {arXiv preprint arXiv:1609.07730},
year = {2016}
}