中文

面向视觉查询在野外的分割

计算机视觉与模式识别 2026-03-11 v1

摘要

在本文中,我们引入了视觉查询分割 (VQS),这是一种新的视觉查询定位 (VQL) 范式,旨在给定外部视觉查询,在未剪辑的视频中对目标对象的所有像素级出现进行分段。与现有的 VQL 仅定位目标最后一个外观的做法不同,VQS 实现了更为全面(即所有对象出现)和精确(即像素级掩码)的定位,使其在现实场景中更为实用。为促进该任务的研究,我们present了 VQS-4K,一个大规模基准数据集,专为 VQS 设计。具体而言,VQS-4K 包含 4,111 个视频,超过 130 万帧,涵盖 222 个对象类别。每个视频都配有一个由搜索视频之外的帧及其目标掩码定义的视觉查询,并标注有对应的查询目标的空间-时间掩码块。为确保高质量,我们对 VQS-4K 中的所有视频进行仔人检查和迭代细化。据我们所知,VQS-4K 是第一个专为 VQS 设计的基准数据集。此外,为了激励未来的研究,我们present了一种简单而有效的方法,称为 VQ-SAM,该方法通过利用来自视频的目标特定 cues 和背景干扰 cues 来逐步演化记忆,引入一种新的多阶段框架和适应性记忆生成 (AMG) 模块用于 VQS,显著提高了性能。在我们对 VQS-4K 上进行的广泛实验中,VQ-SAM 实现了有前景的结果,并超越了所有现有方法,证明了其有效性。我们提出的 VQS-4K 和 VQ-SAM 预计将超越当前的 VQL 范式,激发更多未来的研究和实际应用。我们的数据集、代码和结果将公开提供。

关键词

引用

@article{arxiv.2603.08897,
  title  = {Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures},
  author = {David Fernandez and Pedram MohajerAnsari and Amir Salarpour and Long Cheng and Abolfazl Razi and Mert D. Pesé},
  journal= {arXiv preprint arXiv:2603.08897},
  year   = {2026}
}

备注

Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)