中文

M2N2V2:多模态无监督且免训练的交互式分割

计算机视觉与模式识别 2025-03-21 v1

摘要

我们提出了 Markov Map Nearest Neighbor V2 (M2N2V2),一种新颖、简单且有效的方法,该方法利用深度引导和注意力图进行无监督且免训练的基于点提示的交互式分割。遵循监督多模态方法的最新趋势,我们谨慎地将深度作为一种附加模态进行集成,以创建新颖的深度引导 Markov 图。此外,我们观察到 M2N2 在交互过程中偶尔会出现分割尺寸波动,这可能会降低整体的 mIoU。为了缓解这一问题,我们将提示建模为一个序列过程,并提出了一种新颖的自适应评分函数,该函数考虑了先前的分割结果和当前的提示点,以防止不合理的分割尺寸变化。使用 Stable Diffusion 2 和 Depth Anything V2 作为骨干网络,我们通过实验证明,与 M2N2 相比,我们提出的 M2N2V2 在除医学领域以外的所有数据集上均显著改善了点击次数和 mIoU。有趣的是,在更具挑战性的 DAVIS 和 HQSeg44K 数据集上,我们的无监督方法在 NoC 指标上取得了与 SAM 和 SimpleClick 等监督方法相媲美的结果,缩小了监督方法与无监督方法之间的差距。

关键词

引用

@article{arxiv.2503.16254,
  title  = {M2N2V2: Multi-Modal Unsupervised and Training-free Interactive Segmentation},
  author = {Markus Karmann and Peng-Tao Jiang and Bo Li and Onay Urfalioglu},
  journal= {arXiv preprint arXiv:2503.16254},
  year   = {2025}
}