用于答案定位的句子注意力模块
计算机视觉与模式识别
2023-09-22 v1
摘要
答案定位是为视觉问答任务定位相关视觉证据的任务。尽管已引入多种注意力方法用于该任务,它们存在以下三类问题:设计不允许使用预训练网络且无法从大规模数据预训练中获益;基于非扎实已有设计的定制设计,从而限制了网络的学习能力;或复杂设计导致难以复现或改进。本文提出一种称为句子注意力块(Sentence Attention Block)的新架构模块以解决这些问题。所提模块通过显式建模图像特征图与句子嵌入间的相互依赖关系,对通道级图像特征图进行重标定。我们可视化展示了该模块如何基于句子嵌入过滤掉无关的特征图通道。我们的设计始于一种知名的注意力方法,并通过微小修改改进结果以达到最先进准确率。方法的灵活性使其易于使用不同预训练骨干网络,其简洁性便于理解与复现。我们在 TextVQA-X、VQS、VQA-X 与 VizWiz-VQA-Grounding 数据集上验证了方法有效性,并进行了多项消融实验以展示设计选择的有效性。
引用
@article{arxiv.2309.11593,
title = {Sentence Attention Blocks for Answer Grounding},
author = {Seyedalireza Khoshsirat and Chandra Kambhamettu},
journal= {arXiv preprint arXiv:2309.11593},
year = {2023}
}