中文

INSID3:基于 DINOv3 的无训练上下文分割

计算机视觉与模式识别 2026-03-31 v1

摘要

上下文分割(ICS)旨在根据一个标注的视觉示例分割任意概念,例如物体、部件或个性化实例。现有工作依赖于(i)对视觉基础模型(VFMs)进行微调,这改善了域内结果但损害了泛化能力,或(ii)组合多个冻结的 VFMs,这保留了泛化能力但导致架构复杂性和固定的分割粒度。我们从极简主义的角度重新审视 ICS,并提出问题:单个自监督骨干网络能否在不使用任何监督或辅助模型的情况下同时支持语义匹配和分割?我们证明 DINOv3 的放大密集自监督特征展现出强大的空间结构和语义对应性。我们提出了 INSID3,一种无需训练的方法,仅从冻结的 DINOv3 特征出发,根据上下文示例即可在 varying granularities 下分割概念。INSID3 在单次语义分割、部件分割和个性化分割上取得了最先进的结果,比先前工作提升了 +7.5% mIoU,同时使用了 3 倍的参数量且无需任何掩码或类别级监督。代码可在 https://github.com/visinf/INSID3 获取。

关键词

引用

@article{arxiv.2603.28480,
  title  = {INSID3: Training-Free In-Context Segmentation with DINOv3},
  author = {Claudia Cuttano and Gabriele Trivigno and Christoph Reich and Daniel Cremers and Carlo Masone and Stefan Roth},
  journal= {arXiv preprint arXiv:2603.28480},
  year   = {2026}
}

备注

CVPR 2026. Project page: https://visinf.github.io/INSID3