中文

即插即用调节器用于图文匹配

计算机视觉与模式识别 2023-05-03 v1 多媒体

摘要

利用细粒度对应和视觉-语义对齐在图文匹配中已展现出巨大潜力。通常,近期方法首先采用跨模态注意力单元来捕获潜在的区域-词交互,然后整合所有对齐以获得最终相似度。然而,它们大多采用具有复杂架构或额外信息的一次性前向关联或聚合策略,而忽略了网络反馈的调节能力。本文中,我们开发了两种简单但十分有效的调节器,可高效编码输出信息以自动语境化并聚合跨模态表示。具体而言,我们提出(i)循环对应调节器(RCR),其通过自适应注意力因子逐步增强跨模态注意力单元,以捕获更灵活的对应;以及(ii)循环聚合调节器(RAR),其反复调整聚合权重,逐步强调重要对齐并稀释不重要对齐。此外有趣的是,RCR 和 RAR 是即插即用的:二者均可嵌入到许多基于跨模态交互的框架中以获得显著收益,且它们的协作可实现进一步提升。在 MSCOCO 和 Flickr30K 数据集上的大量实验验证,它们能为多个模型带来令人印象深刻的且一致的 R@1 增益,证实了所提方法的通用有效性与泛化能力。代码与预训练模型见:https://github.com/Paranioar/RCAR。

关键词

引用

@article{arxiv.2303.13371,
  title  = {Plug-and-Play Regulators for Image-Text Matching},
  author = {Haiwen Diao and Ying Zhang and Wei Liu and Xiang Ruan and Huchuan Lu},
  journal= {arXiv preprint arXiv:2303.13371},
  year   = {2023}
}

备注

13 pages, 9 figures, Accepted by TIP2023