UnSAMv2:自监督学习实现任意粒度的分割一切
计算机视觉与模式识别
2025-11-18 v1 人工智能
机器学习
摘要
Segment Anything Model(SAM)系列已成为广泛采用的视觉基础模型,但其控制分割粒度的能力仍然有限。用户通常需要手动优化结果——通过添加更多提示或从预先生成的掩码中选择——以达到所需的细节水平。这个过程可能模糊不清,因为同一个提示可能对应多个合理的掩码,并且收集所有粒度级别的密集标注成本过高,使得监督式解决方案不可行。为了解决这一局限,我们引入了UnSAMv2,它无需人工标注即可实现任意粒度的分割一切。UnSAMv2扩展了UnSAM的分治策略,通过发现丰富的掩码-粒度对,并引入一种新颖的粒度控制嵌入,实现了对分割尺度的精确、连续控制。值得注意的是,仅使用6K张无标注图像和0.02%的额外参数,UnSAMv2就显著增强了SAM-2,在交互式、全图和视频分割任务中实现了任意粒度的分割一切。在超过11个基准测试上的评估显示,UnSAMv2提升了NoC90(5.69 → 4.75)、1-IoU(58.0 → 73.1)和AR1000(49.6 → 68.3),表明少量无标注数据结合粒度感知的自监督学习方法可以释放视觉基础模型的潜力。
引用
@article{arxiv.2511.13714,
title = {UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity},
author = {Junwei Yu and Trevor Darrell and XuDong Wang},
journal= {arXiv preprint arXiv:2511.13714},
year = {2025}
}