基于注意力驱动的视觉锚定约束平衡
计算机视觉与模式识别
2024-07-09 v2
摘要
与对象检测不同,视觉锚定任务需要检测由复杂自由形式语言描述的对象。为同时建模这种复杂的语义和视觉表示,近期的先进方法采用基于转换器的模型来融合两 modalities 的特征,进而引入各种模块来调制视觉特征以与语言表达式对齐并消除不相关的冗余信息。然而,他们的损失函数仍采用常规对象检测损失,仅支配边界框回归输出,未能充分优化上述目标。为解决此问题,本文首先分析了基于转换器的模型的注意力机制。此后,我们进一步提出一种名为注意力驱动约束平衡 (AttBalance) 的新型框架,以优化视觉特征在语言相关区域的行为。大量实验结果表明,我们的方法带来了显著的改进。具体而言,我们在四个不同基准上的五个不同模型上均实现了持续的性能提升。此外,我们通过将该方法集成到 QRNet 中,实现了最新的性能水平。
引用
@article{arxiv.2407.03243,
title = {Visual Grounding with Attention-Driven Constraint Balancing},
author = {Weitai Kang and Luowei Zhou and Junyi Wu and Changchang Sun and Yan Yan},
journal= {arXiv preprint arXiv:2407.03243},
year = {2024}
}