中文

SEGIC:释放视觉基础模型中涌现对应关系的上下文分割能力

计算机视觉与模式识别 2024-07-23 v3

摘要

上下文分割旨在利用少量标注示例图像(称为“上下文示例”)对新图像进行分割,探索示例与目标之间的内容相似性。由此得到的模型可无缝泛化至新颖分割任务,与常规流程相比显著降低了标注与训练成本。然而,上下文分割比经典分割更具挑战性,要求模型学习以少量样本为条件的分割规则。与以往临时或非端到端的设计不同,我们提出 SEGIC,一种基于单一视觉基础模型(VFM)构建的端到端上下文分割框架。具体而言,SEGIC 利用 VFM 内部的涌现对应关系来捕获目标图像与上下文样本之间的密集关联。据此,来自上下文样本的信息被提取为三类指令,即几何指令、视觉指令与元指令,作为最终掩码预测的显式条件。SEGIC 是一种简洁而有效的方法,在单样本分割基准上取得了最先进的性能。值得注意的是,SEGIC 可轻松泛化至多种任务,包括视频目标分割与开放词汇分割。代码将发布于 https://github.com/MengLcool/SEGIC。

关键词

引用

@article{arxiv.2311.14671,
  title  = {SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation},
  author = {Lingchen Meng and Shiyi Lan and Hengduo Li and Jose M. Alvarez and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2311.14671},
  year   = {2024}
}

备注

ECCV-24 camera-ready