序列到序列网络的摊销上下文向量推断
机器学习
2019-01-07 v9 机器学习
摘要
神经注意力(NA)已成为序列到序列模型的关键组件,这类模型在如抽象文档摘要(ADS)和视频字幕(VC)等困难任务上取得了最先进的性能。NA 机制执行上下文向量的推断;这些向量构成确定性输入序列编码的加权和,在长时域上自适应地获取。受摊销变分推断(AVI)领域近期工作的启发,本工作中我们考虑将软注意力(SA)模型生成的上下文向量视为潜变量,其近似有限混合模型后验通过 AVI 推断。我们假定该公式可带来更强的泛化能力,与现有 AVI 应用于深度网络的成果一致。为说明我们的方法,我们实现了它并在具有挑战性的 ADS、VC 和 MT 基准上进行了实验评估。由此,我们展示了其相对于最先进替代方法的改进有效性。
引用
@article{arxiv.1805.09039,
title = {Amortized Context Vector Inference for Sequence-to-Sequence Networks},
author = {Kyriacos Tolias and Ioannis Kourouklides and Sotirios Chatzis},
journal= {arXiv preprint arXiv:1805.09039},
year = {2019}
}
备注
Submitted for Review