中文

告诉我证据?用于答案定位的双重视觉-语言交互

计算机视觉与模式识别 2022-07-13 v1

摘要

答案定位旨在揭示视觉问答(VQA)的视觉证据,这需要在回答关于图像的问题时高亮图像中的相关位置。以往的尝试通常使用预训练目标检测器来解决此问题,但对于不在预定义词汇表中的对象缺乏灵活性。然而,这些黑盒方法仅关注语言生成,忽略了视觉可解释性。在本文中,我们提出双重视觉-语言交互(DaVI),一种新颖的统一端到端框架,具备语言回答和视觉定位的能力。DaVI 创新性地引入了两种视觉-语言交互机制:1)基于视觉的语言编码器,其结合视觉特征理解问题并为进一步答案解码生成语言导向的证据;2)基于语言的视觉解码器,其将视觉特征聚焦于证据相关区域以实现答案定位。由此,我们的方法在 2022 年 VizWiz Grand Challenge 的答案定位赛道中排名第一位。

关键词

引用

@article{arxiv.2207.05703,
  title  = {Tell Me the Evidence? Dual Visual-Linguistic Interaction for Answer Grounding},
  author = {Junwen Pan and Guanlin Chen and Yi Liu and Jiexiang Wang and Cheng Bian and Pengfei Zhu and Zhicheng Zhang},
  journal= {arXiv preprint arXiv:2207.05703},
  year   = {2022}
}

备注

Accepted to CVPR 2022 VizWiz Workshop