MITVG:具有视觉定位的多模态增量 Transformer 用于视觉对话生成
计算与语言
2021-09-20 v1 计算机视觉与模式识别
多媒体
摘要
视觉对话是一项具有挑战性的任务,因其需要在理解视觉环境的基础上回答一系列连贯问题。先前研究通过隐式关注空间图像特征或对象级图像特征来隐式探索多模态共指,但忽视了在视觉内容中显式定位与文本内容中实体相关联对象的重要性。因此,本文提出一种具有视觉定位的多模态增量 Transformer(MITVG),其由两个关键部分组成:视觉定位与多模态增量 Transformer。视觉定位旨在由文本实体引导显式定位图像中相关对象,帮助模型排除无需关注的视觉内容。基于视觉定位,多模态增量 Transformer 按对话顺序逐步编码结合视觉场景的多轮对话历史,进而生成上下文与视觉连贯的回复。在 VisDial v0.9 与 v1.0 数据集上的实验结果证明了所提模型的优越性,其取得了可比性能。
引用
@article{arxiv.2109.08478,
title = {Multimodal Incremental Transformer with Visual Grounding for Visual Dialogue Generation},
author = {Feilong Chen and Fandong Meng and Xiuyi Chen and Peng Li and Jie Zhou},
journal= {arXiv preprint arXiv:2109.08478},
year = {2021}
}
备注
ACL Fingdings 2021