一种更简单且更优的视觉定位基线
计算机视觉与模式识别
2025-10-14 v1
摘要
视觉定位旨在预测由文本描述指定的目标对象位置。对于这种具有语言和视觉模态的任务,当前研究的一个热点方向仅关注选择与语言相关的视觉区域进行对象定位,以减少计算开销。虽然取得了令人印象深刻的性能,但该方法是在不同图像尺度上迭代执行的,并且在每一次迭代中,都需要将语言特征和视觉特征存储在缓存中,从而引入额外的开销。为便于实现,本文提出了一种基于特征选择的简单而有效的视觉定位基线方法,称为 FSVG。具体而言,我们直接将语言和视觉模态封装到一个整体的网络架构中,而无需复杂的迭代过程,并利用语言并行作为引导,以促进语言模态与视觉模态之间的交互,从而提取有效的视觉特征。此外,为降低计算成本,在视觉特征学习过程中,我们引入一种基于相似性的特征选择机制,仅利用与语言相关的视觉特征以实现更快的预测。对多个基准数据集上的大量实验结果充分表明,所提出的 FSVG 在准确率和效率之间实现了超越当前最先进方法的更好平衡。代码已公开于 https://github.com/jcwang0602/FSVG。
引用
@article{arxiv.2510.10587,
title = {A Simple and Better Baseline for Visual Grounding},
author = {Jingchao Wang and Wenlong Zhang and Dingjiang Huang and Hong Wang and Yefeng Zheng},
journal= {arXiv preprint arXiv:2510.10587},
year = {2025}
}
备注
ICME2025