中文

以正确图像区域作答:一种视觉注意力正则化方法

计算机视觉与模式识别 2021-11-09 v2

摘要

视觉问答(VQA)中的视觉注意力旨在定位与答案预测相关的正确图像区域,为促进多模态理解提供了强大技术。然而,近期研究指出,视觉注意力所高亮的图像区域常与给定问题和答案无关,导致模型在正确视觉推理上产生混淆。为解决此问题,现有方法多求助于将视觉注意力权重与人工注意力对齐。但收集此类人工数据费力且昂贵,使得成熟模型难以跨数据集良好适配。针对该问题,本文设计了一种新颖的视觉注意力正则化方法,即 AttReg,以在 VQA 中实现更好的视觉定位。具体而言,AttReg 首先识别对问答至关重要却被骨干模型意外忽略(即被赋予低注意力权重)的图像区域,随后利用掩码引导学习机制正则化视觉注意力,使其更多聚焦于这些被忽略的关键区域。所提方法非常灵活且与模型无关,可集成至大多数基于视觉注意力的 VQA 模型,且无需人工注意力监督。我们在三个基准数据集(即 VQA-CP v2、VQA-CP v1 和 VQA v2)上进行了大量实验以评估 AttReg 的有效性。作为副产物,将 AttReg 融入强基线 LMH 后,我们的方法在 VQA-CP v2 基准数据集上以 7.01% 的绝对性能提升取得了 60.00% 的新最优准确率……

关键词

引用

@article{arxiv.2102.01916,
  title  = {Answer Questions with Right Image Regions: A Visual Attention Regularization Approach},
  author = {Yibing Liu and Yangyang Guo and Jianhua Yin and Xuemeng Song and Weifeng Liu and Liqiang Nie},
  journal= {arXiv preprint arXiv:2102.01916},
  year   = {2021}
}

备注

ACM TOMM 2021