中文

XR-VLM:基于多部分提示与视觉特征的跨关系建模用于细粒度识别

计算机视觉与模式识别 2025-03-11 v1

摘要

视觉-语言模型在各种视觉任务上展现了出色的性能,但它们仍需在下游任务上进行适配以实现最优性能。近期提出了多种适配技术,但我们观察到它们在细粒度视觉识别中往往表现不佳,这要求模型捕捉细微但具区分性的特征以区分相似的子类别。当前的适配方法通常依赖基于对齐的预测框架,即视觉特征与每个类别提示进行比较以计算相似性作为最终预测,这在正向传播过程中缺乏类别间交互。此外,学习单一的单模态特征进一步限制了模型的表达能力。因此,我们提出了一种新机制 XR-VLM,通过建模跨关系来发现细微差异,这在涉及多个特征的场景中尤为出色。我们的方法引入了一个统一的多部分视觉特征提取模块,旨在与 VLM 中固有的多样化骨干网络无缝集成。此外,我们开发了一个多部分提示学习模块,以捕捉子类别的多视角描述。为进一步增强区分能力,我们提出了一种将视觉特征与所有类别提示特征相结合的跨关系建模模式,从而能够更深入地探索这两种模态之间的关系。在多个细粒度数据集上进行了大量实验,结果表明与当前最先进的方法相比,我们的方法取得了显著改进。代码将开源。

关键词

引用

@article{arxiv.2503.07075,
  title  = {XR-VLM: Cross-Relationship Modeling with Multi-part Prompts and Visual Features for Fine-Grained Recognition},
  author = {Chuanming Wang and Henming Mao and Huanhuan Zhang and Huiyuan Fu and Huadong Ma},
  journal= {arXiv preprint arXiv:2503.07075},
  year   = {2025}
}