SAM-MI:用于增强开放词汇语义分割的掩码注入框架
计算机视觉与模式识别
2025-11-26 v1
摘要
开放词汇语义分割(OVSS)旨在对对象进行通用分割与识别。在大规模高质量分割数据上训练的分割即模型(SAM)已显示出卓越的通用分割能力,为OVSS提供了有价值的支持。尽管先前方法在利用SAM for OVSS方面取得了进展,但仍面临一些挑战:(1) SAM倾向于过度分割,(2)固定掩码与标签之间的难以组合。本文引入一种新型掩码注入框架SAM-MI,通过有效整合SAM与OVSS模型来解决上述挑战。首先,SAM-MI采用文本引导稀疏点提示器(sample sparse prompts)代替以往的稠密网格式提示,从而显著加快掩码生成过程。随后,引入浅层掩码聚合(SMAgg)以合并部分掩码,以缓解SAM的过度分割问题。最后,解耦掩码注入(DMI)将SAM生成的掩码以低频和高频分别进行指导,而非直接将其与标签组合。广泛的实验在多个基准数据集上验证了SAM-MI的优越性。值得注意的是,本文提出的方法在MESS 数据集上相较于Grounded-SAM 实现了16.7%的相对mIoU 提升,同时实现了1.6倍的加速。我们希望SAM-MI 能作为一种有效为OVSS模型装配SAM的替代方法。
引用
@article{arxiv.2511.20027,
title = {SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM},
author = {Lin Chen and Yingjian Zhu and Qi Yang and Xin Niu and Kun Ding and Shiming Xiang},
journal= {arXiv preprint arXiv:2511.20027},
year = {2025}
}