基于双一致性的 DC-SAM:通过提示调优实现图像和视频中的上下文分割
摘要
给定单个已标记示例,上下文分割旨在分割对应的对象。这种设置,称为 few-shot learning 中的 one-shot 分割,探索了分割模型的泛化能力,并已应用于各种视觉任务,包括场景理解和图像/视频编辑。尽管最近的 Segment Anything Models(SAM)在交互式分割方面取得了最新进展,但这些方法直接适用于上下文分割。本文我们基于提示调优为 SAM 和 SAM2 提出一种双一致性方法(DC-SAM),用于图像和视频的上下文分割。我们的关键见解是通过提供高质量的视觉提示来增强 SAM 提示编码器的特征。在生成掩码先验时,我们融合 SAM 特征以更好地对齐提示编码器。然后,我们在融合特征和初始视觉提示上设计一种循环一致的交叉注意力。接着,我们提供一种双分支设计,利用在提示编码器中使用的判别性正向和负向提示。 Furthermore, 我们设计一种简单的掩码管训练策略,将我们提出的双一致性方法应用于掩码管。虽然所提议的 DC-SAM主要为图像设计,但它可以借助 SAM2 无缝扩展到视频领域。鉴于视频领域缺乏上下文分割,我们手动 curated and构建了第一个基准数据集,称为 In-Context Video Object Segmentation(IC-VOS),以更好地评估模型的上下文能力。大量实验表明,我们的方法在 COCO-20i 上实现了 55.5(+1.4)mIoU,在 PASCAL-5i 上实现了 73.0(+1.1)mIoU,并在我们提出的 IC-VOS 基准上获得了 71.52 的 J&F 分数。我们的源代码和基准数据集可在 https://github.com/zaplm/DC-SAM 上获取。
引用
@article{arxiv.2504.12080,
title = {DC-SAM: In-Context Segment Anything in Images and Videos via Dual Consistency},
author = {Mengshi Qi and Pengfei Zhu and Xiangtai Li and Xiaoyang Bi and Lu Qi and Huadong Ma and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2504.12080},
year = {2025}
}
备注
V1 has been withdrawn due to a template issue, because of the arXiv policy, we can't delete it. Please refer to the newest version v2