中文

通过最优传输改进序列到序列学习

计算与语言 2019-01-21 v1

摘要

序列到序列模型通常通过最大似然估计(Maximum Likelihood Estimation, MLE)进行训练。然而,标准的 MLE 训练采用词级别目标,即在给定先前真实部分句子的条件下预测下一个词。该过程侧重于建模局部句法模式,可能无法捕捉长程语义结构。我们提出了一种新颖的解决方案来缓解这些问题。我们的方法通过基于最优传输的新监督机制施加全局序列级指导,从而实现对语义特征的整体表征与保留。我们进一步表明,该方法可以理解为试图将我们的模型与真实序列分布相匹配的 Wasserstein 梯度流。我们进行了大量实验以验证所提方法的效用,结果表明在包括机器翻译、生成式文本摘要和图像描述在内的多种 NLP 任务上均取得了一致的改进。

关键词

引用

@article{arxiv.1901.06283,
  title  = {Improving Sequence-to-Sequence Learning via Optimal Transport},
  author = {Liqun Chen and Yizhe Zhang and Ruiyi Zhang and Chenyang Tao and Zhe Gan and Haichao Zhang and Bai Li and Dinghan Shen and Changyou Chen and Lawrence Carin},
  journal= {arXiv preprint arXiv:1901.06283},
  year   = {2019}
}