视觉-语言 Transformer 中面向视觉问答的弱监督定位
计算机视觉与模式识别
2022-07-07 v1
摘要
用于视觉-语言表征学习的 Transformer 受到了大量关注,并在视觉问答(VQA)和定位任务上展现出卓越性能。但大多数在这些任务上表现良好的系统仍在训练期间依赖预训练的目标检测器,这限制了它们对检测器可用目标类别的适用性。为缓解此限制,本文关注 Transformer 中视觉问答背景下的弱监督定位问题。该方法利用胶囊(capsules),将视觉编码器中每个视觉 token 分组,并使用来自语言自注意力层的激活作为文本引导的选择模块,在胶囊被传递到下一层之前对其进行掩码。我们在具有挑战性的 GQA 以及 VQA-HAT 数据集上评估了我们的方法用于 VQA 定位。我们的实验表明:虽然从标准 Transformer 架构中移除被掩码目标的信息会导致性能显著下降,但胶囊的集成显著提升了此类系统的定位能力,并相较于该领域其他方法提供了全新的 SOTA 结果。
引用
@article{arxiv.2207.02334,
title = {Weakly Supervised Grounding for VQA in Vision-Language Transformers},
author = {Aisha Urooj Khan and Hilde Kuehne and Chuang Gan and Niels Da Vitoria Lobo and Mubarak Shah},
journal= {arXiv preprint arXiv:2207.02334},
year = {2022}
}
备注
To appear at ECCV 2022