Cseq2seq:循环序列到序列学习
计算与语言
2018-11-27 v2
摘要
原始的序列到序列学习(seq2seq)仅读取并将源序列编码为定长向量一次,这使其在建模源序列与目标序列之间的结构对应关系时存在不足。在本文中,我们没有使用线性加权注意力机制来处理这一不足,而是提出使用循环神经网络(RNN)作为替代(Cseq2seq-I)。在解码过程中,Cseq2seq-I 将先前的解码状态循环反馈给编码器作为 RNN 的初始状态,并重新编码源表示以生成上下文向量。我们惊讶地发现,引入的 RNN 能够根据部分目标序列动态检测与翻译相关的源词元。基于这一发现,我们进一步假设部分目标序列可以作为反馈来改善对源序列的理解。为了验证这一假设,我们提出了循环序列到序列学习(Cseq2seq-II),它与 seq2seq 的区别仅在于将先前的解码状态重新引入同一编码器。我们进一步对 Cseq2seq-II 进行参数共享,以减少参数冗余并增强正则化。具体而言,我们共享编码器与解码器的权重以及两个目标侧词嵌入,使 Cseq2seq-II 等价于单个条件 RNN 模型,在裁剪了 31% 参数的情况下性能甚至更优。Cseq2seq-II 不仅保留了 seq2seq 的简洁性,而且在机器翻译任务上取得了相当且有前景的结果。在中英和英德翻译上的实验表明,Cseq2seq 相比 seq2seq 取得了显著且一致的改进,并且与基于注意力的 seq2seq 模型同样具有竞争力。
引用
@article{arxiv.1607.08725,
title = {Cseq2seq: Cyclic Sequence-to-Sequence Learning},
author = {Biao Zhang and Deyi Xiong and Jinsong Su},
journal= {arXiv preprint arXiv:1607.08725},
year = {2018}
}
备注
Submitted to EMNLP2016, original version, updated version of "Recurrent Neural Machine Translation"