将更多注意力转向视觉骨干:用于端到端视觉定位的查询调制精炼网络
计算机视觉与模式识别
2022-03-30 v1 多媒体
摘要
视觉定位致力于建立视觉与自然语言间的细粒度对齐,在多模态推理系统中具有关键应用。现有方法使用预训练的查询无关视觉骨干独立提取视觉特征图,而不考虑查询信息。我们认为,从视觉骨干提取的视觉特征与多模态推理真正需要的特征不一致。一个原因是预训练任务与视觉定位间存在差异。此外,由于骨干是查询无关的,在视觉定位框架中通过端到端训练视觉骨干难以完全避免不一致问题。本文提出查询调制精炼网络(QRNet),通过新颖的查询感知动态注意力(QD-ATT)机制和查询感知多尺度融合调整视觉骨干中的中间特征,以解决不一致问题。QD-ATT可在视觉骨干生成的特征图的空间和通道级别动态计算查询依赖的视觉注意力。我们将QRNet应用于端到端视觉定位框架。大量实验表明,所提方法在五个广泛使用的数据集上优于最先进方法。
引用
@article{arxiv.2203.15442,
title = {Shifting More Attention to Visual Backbone: Query-modulated Refinement Networks for End-to-End Visual Grounding},
author = {Jiabo Ye and Junfeng Tian and Ming Yan and Xiaoshan Yang and Xuwu Wang and Ji Zhang and Liang He and Xin Lin},
journal= {arXiv preprint arXiv:2203.15442},
year = {2022}
}