中文

基于视觉与语言嵌入的时间图像识别

计算机视觉与模式识别 2025-09-12 v1

摘要

视觉语言模型(VLMs)通过图像-文本对齐实现了强大的零样本分类能力。然而,其纯视觉推理能力仍未得到充分探索。本文对包括SigLIP 2和RADIOv2.5等众多双编码器VLMs进行了全面评估,既进行语言引导的图像分类,也进行纯视觉图像分类。在ImageNet-1k验证集及其标签纠正变体上的标准设置下进行比较。分析了影响准确率的关键因素,包括提示设计、类别多样性、k-最近邻的邻居数量以及参考集大小。我们展示,语言和视觉提供互补的优势,某些类别更适合文本提示,而另一些则更适合视觉相似性。为充分利用这种互补性,我们引入一种基于每类精确度的简单、无需学习的融合方法,可提高分类性能。代码已公开:https://github.com/gonikisgo/bmvc2025-vlm-image-recognition。

关键词

引用

@article{arxiv.2509.09311,
  title  = {Image Recognition with Vision and Language Embeddings of VLMs},
  author = {Illia Volkov and Nikita Kisel and Klara Janouskova and Jiri Matas},
  journal= {arXiv preprint arXiv:2509.09311},
  year   = {2025}
}