DMRM:一种用于视觉对话的双通道多跳推理模型
计算与语言
2019-12-19 v1
摘要
视觉对话是一项视觉-语言任务,要求 AI 智能体基于图像与人类进行对话。这仍是一项具有挑战性的任务,因为它要求智能体在做出恰当回复之前,不仅要从文本对话历史中,还要从视觉基础信息中充分理解所给问题。先前模型通常利用单跳推理或单通道推理来处理这一复杂的多模态推理任务,这直观上是不充分的。因此,本文提出一种新颖且更强大的用于视觉对话的双通道多跳推理模型,称为 DMRM。DMRM 通过利用双通道推理,同步从对话历史和图像中捕获信息,以丰富问题的语义表示。具体而言,DMRM 在每个通道中通过多跳推理过程维持双通道,以获得问题-历史感知的图像特征以及问题-图像感知的对话历史特征。此外,我们还设计了一种有效的多模态注意力,以进一步增强解码器生成更准确的回复。在 VisDial v0.9 和 v1.0 数据集上的实验结果表明,所提模型是有效的,并以显著优势优于对比模型。
引用
@article{arxiv.1912.08360,
title = {DMRM: A Dual-channel Multi-hop Reasoning Model for Visual Dialog},
author = {Feilong Chen and Fandong Meng and Jiaming Xu and Peng Li and Bo Xu and Jie Zhou},
journal= {arXiv preprint arXiv:1912.08360},
year = {2019}
}
备注
Accepted at AAAI 2020