中文

动态 MDETR:一种用于视觉定位的动态多模态 Transformer 解码器

计算机视觉与模式识别 2023-10-27 v2

摘要

多模态 transformer 在对齐图像与文本以进行视觉定位方面表现出高容量与灵活性。然而,现有的仅编码器定位框架(如 TransVG)由于具有二次时间复杂度的自注意力操作而计算繁重。为解决该问题,我们提出一种新的多模态 transformer 架构,称为动态多模态 DETR(Dynamic MDETR),将整个定位过程解耦为编码与解码阶段。关键观察在于图像中存在高度空间冗余。因此,我们利用该稀疏性先验设计了一种新的动态多模态 transformer 解码器,以加速视觉定位过程。具体而言,我们的动态解码器由 2D 自适应采样模块与文本引导解码模块组成。采样模块旨在通过预测相对于参考点的偏移来选取这些具信息量的图像块,而解码模块通过对图像特征与文本特征执行交叉注意力来提取被定位对象的信息。这两个模块交替堆叠,以逐步弥合模态鸿沟并迭代细化被定位对象的参考点,最终达成视觉定位目标。在五个基准上的大量实验表明,我们提出的 Dynamic MDETR 在计算与精度间取得了有竞争力的权衡。值得注意的是,解码器仅使用 9% 的特征点,我们便可减少多模态 transformer 约 44% 的 GFLOPs,但仍取得高于仅编码器对应模型的精度。此外,为验证其泛化能力并扩展我们的 Dynamic MDETR,我们构建了首个单阶段 CLIP 赋能的视觉定位框架,并在这些基准上取得最先进(SOTA)性能。

关键词

引用

@article{arxiv.2209.13959,
  title  = {Dynamic MDETR: A Dynamic Multimodal Transformer Decoder for Visual Grounding},
  author = {Fengyuan Shi and Ruopeng Gao and Weilin Huang and Limin Wang},
  journal= {arXiv preprint arXiv:2209.13959},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) in October 2023