V$^{2}$-SAM:将 SAM2 与多提示专家结合用于跨视角物体对应
计算机视觉与模式识别
2026-04-09 v2
摘要
跨视角物体对应,以自我-外部物体对应这一代表性任务为例,旨在为同一物体在不同视角(例如,第一人称视角和第三人称视角)下建立一致的关联。由于剧烈的视角和外观变化,该任务面临重大挑战,使得现有分割模型(如 SAM2)难以直接应用。为了解决这个问题,我们提出了 V2-SAM,一个统一的跨视角物体对应框架,它通过两个互补的提示生成器将 SAM2 从单视角分割适配到跨视角对应。具体来说,基于 DINOv3 特征构建的跨视角锚点提示生成器 (V2-Anchor) 建立了几何感知的对应关系,并首次在跨视角场景中为 SAM2 实现了基于坐标的提示,而跨视角视觉提示生成器 (V2-Visual) 则通过一个新颖的视觉提示匹配器增强外观引导的线索,该匹配器从特征和结构两个角度对齐自我-外部视角的表征。为了有效利用两种提示的优势,我们进一步采用了多专家设计,并引入了一个事后循环一致性选择器 (PCCS),它基于循环一致性自适应地选择最可靠的专家。大量实验验证了 V2-SAM 的有效性,在 Ego-Exo4D(自我-外部视角物体对应)、DAVIS-2017(视频物体跟踪)和 HANDAL-X(面向机器人的跨视角对应)上取得了新的最先进性能。
引用
@article{arxiv.2511.20886,
title = {V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence},
author = {Jiancheng Pan and Runze Wang and Tianwen Qian and Mohammad Mahdi and Yanwei Fu and Xiangyang Xue and Xiaomeng Huang and Luc Van Gool and Danda Pani Paudel and Yuqian Fu},
journal= {arXiv preprint arXiv:2511.20886},
year = {2026}
}
备注
19 pages