中文

序列到序列网络的摊销上下文向量推断

机器学习 2019-01-07 v9 机器学习

摘要

神经注意力(NA)已成为序列到序列模型的关键组件,这类模型在如抽象文档摘要(ADS)和视频字幕(VC)等困难任务上取得了最先进的性能。NA 机制执行上下文向量的推断;这些向量构成确定性输入序列编码的加权和,在长时域上自适应地获取。受摊销变分推断(AVI)领域近期工作的启发,本工作中我们考虑将软注意力(SA)模型生成的上下文向量视为潜变量,其近似有限混合模型后验通过 AVI 推断。我们假定该公式可带来更强的泛化能力,与现有 AVI 应用于深度网络的成果一致。为说明我们的方法,我们实现了它并在具有挑战性的 ADS、VC 和 MT 基准上进行了实验评估。由此,我们展示了其相对于最先进替代方法的改进有效性。

关键词

引用

@article{arxiv.1805.09039,
  title  = {Amortized Context Vector Inference for Sequence-to-Sequence Networks},
  author = {Kyriacos Tolias and Ioannis Kourouklides and Sotirios Chatzis},
  journal= {arXiv preprint arXiv:1805.09039},
  year   = {2019}
}

备注

Submitted for Review