LOIS:面向视觉问答的实例语义外察方法
计算机视觉与模式识别
2023-07-27 v1 人工智能
计算与语言
摘要
视觉问答(VQA)作为一种需要弥合视觉与语言以正确推断答案的多模态任务已被广泛研究。近期研究开发了多种基于注意力的模块来解决 VQA 任务。然而,模型推理的性能在很大程度上受限于用于语义理解的视觉处理。大多数现有检测方法依赖于边界框,使 VQA 模型理解图像中物体语义的因果关联并正确推断上下文信息仍是一大严峻挑战。为此,我们在本工作中提出了一种无边界框的更精细模型框架,称为实例语义外察(LOIS),以解决这一重要问题。LOIS 能够实现更细粒度的特征描述以生成视觉事实。此外,为克服实例掩码引起的标签歧义,设计了两类关系注意力模块:1)模态内与 2)模态间,以从不同多视角特征推断正确答案。具体而言,我们实现了一种互关系注意力模块来建模实例物体与背景信息之间复杂而深入的视觉语义关系。另外,我们提出的注意力模型还可通过关注重要的与词相关的问题来进一步分析显著图像区域。在四个基准 VQA 数据集上的实验结果证明,我们所提方法在提升视觉推理能力方面具有良好性能。
引用
@article{arxiv.2307.14142,
title = {LOIS: Looking Out of Instance Semantics for Visual Question Answering},
author = {Siyu Zhang and Yeming Chen and Yaoru Sun and Fang Wang and Haibo Shi and Haoran Wang},
journal= {arXiv preprint arXiv:2307.14142},
year = {2023}
}