中文

两全其美:将判别式学习的知识迁移到生成式视觉对话模型

计算机视觉与模式识别 2017-10-31 v2 人工智能 计算与语言

摘要

我们提出了一种用于神经序列模型的新型训练框架,特别是用于基于上下文的对话生成。这些模型的标准训练范式是极大似然估计 (MLE),即最小化人类响应的交叉熵。在各个领域中,MLE 训练的生成式神经对话模型 (G) 存在一个反复出现的问题,即它们倾向于产生“安全”和通用的响应(“我不知道”,“我无法判断”)。相比之下,被训练来对候选人类响应列表进行排序的判别式对话模型 (D),在自动评估指标、响应的多样性和信息量方面均优于其生成式对应物。然而,D 在实践中并不实用,因为它无法被部署来与用户进行真实对话。我们的工作旨在通过将知识从 D 迁移到 G,实现两全其美——即 G 的实用性和 D 的强性能。我们的主要贡献是一个端到端可训练的生成式视觉对话模型,其中 G 从 D 接收梯度,作为从 G 采样的序列的感知(非对抗)损失。我们利用最近提出的对离散分布的 Gumbel-Softmax (GS) 近似——具体来说,是一个用一系列 GS 采样器增强的 RNN,结合直通梯度估计器来实现端到端的可微性。我们还为视觉对话引入了一个更强的编码器,并在答案编码中采用了自注意力机制以及度量学习损失,以帮助 D 更好地捕捉答案响应中的语义相似性。总体而言,我们提出的模型在 VisDial 数据集上以显著优势(recall@10 上高 2.67%)优于最先进的方法。源代码可从 https://github.com/jiasenlu/visDial.pytorch 下载。

关键词

引用

@article{arxiv.1706.01554,
  title  = {Best of Both Worlds: Transferring Knowledge from Discriminative Learning to a Generative Visual Dialog Model},
  author = {Jiasen Lu and Anitha Kannan and Jianwei Yang and Devi Parikh and Dhruv Batra},
  journal= {arXiv preprint arXiv:1706.01554},
  year   = {2017}
}

备注

11 pages, 3 figures