基于图像级标签的弱监督语义分割:从传统模型到基础模型
计算机视觉与模式识别
2024-12-03 v2
摘要
深度学习的快速发展推动了图像语义分割——计算机视觉中的基础任务——的重大进展。语义分割算法常依赖于像素级标签(即物体掩码)的可用性,其获取昂贵、耗时且费力。弱监督语义分割(WSSS)是避免此类标注的有效方案。它仅利用部分或不完整标注,为全监督语义分割提供经济替代。在本期刊中,我们聚焦于基于图像级标签的 WSSS,其为最具挑战性的 WSSS 形式。我们的工作包含两部分。首先,我们对传统方法进行全面综述,主要关注顶级研究会议上发表的方法。我们依方法作用位置将其分为四类:像素级、图像级、跨图像级与外部数据级。其次,我们考察视觉基础模型(如 Segment Anything Model(SAM))在 WSSS 中的适用性。我们在两种有趣场景下审视 SAM:文本提示与零样本学习。我们就部署视觉基础模型于 WSSS 的潜力与挑战提供见解,以促进这一令人振奋研究领域的未来发展。
引用
@article{arxiv.2310.13026,
title = {Weakly-Supervised Semantic Segmentation with Image-Level Labels: from Traditional Models to Foundation Models},
author = {Zhaozheng Chen and Qianru Sun},
journal= {arXiv preprint arXiv:2310.13026},
year = {2024}
}
备注
Accepted to ACM Computing Surveys