中文

融合视觉大模型的智能图像搜索算法

计算机视觉与模式识别 2025-11-26 v1

摘要

细粒度图像检索旨在查找包含特定对象组件并评估其详细状态的图像,这在安全和工业检查等领域至关重要。然而,传统方法面临显著局限性:手动特征(如 SIFT)缺乏鲁棒性;基于深度学习的检测器(如 YOLO)可以识别组件的存在,但无法执行基于状态的检索或零样本搜索;视觉大模型(VLMs)提供语义和零样本能力,但 suffer 于空间定位不佳且计算成本高,在直接检索中效率低下。为弥合这些差距,本文提出了 DetVLM,一种新型智能图像搜索框架,通过融合对象检测与 VLMs 实现协同。该框架 pioneering 通过两个阶段的 pipeline 实现搜索增强:YOLO 检测器首先进行高召回率的组件级筛选以确定组件的存在;随后,VLMs 作为召回率增强单元,进行二次验证以检查检测器漏检的组件。此架构直接实现两种高级功能:1)状态搜索:受任务特定提示驱动,VLMs 通过验证组件的存在并执行复杂的状态判断(例如“阳光遮挡降低”),从而实现基于组件状态的检索。2)零样本搜索:该框架利用 VLMs 的内在零样本能力识别并检索包含未见组件或属性(例如“戴口罩的司机”)的图像,无需任何任务特定训练。在车辆组件数据集上的实验表明,DetVLM 实现了 94.82% 的总体检索准确率,显著优于仅检测的基线方法。它还在司机戴口罩的零样本搜索中实现了 94.95% 的准确率,并在状态搜索任务中实现了超过 90% 的平均准确率。

关键词

引用

@article{arxiv.2511.19920,
  title  = {Intelligent Image Search Algorithms Fusing Visual Large Models},
  author = {Kehan Wang and Tingqiong Cui and Yang Zhang and Yu Chen and Shifeng Wu and Zhenzhang Li},
  journal= {arXiv preprint arXiv:2511.19920},
  year   = {2025}
}

备注

31 pages,7 figures