DALNet:基于稀疏图像-文本对齐的弱监督语义分割
计算机视觉与模式识别
2024-09-25 v1
摘要
弱监督语义分割(WSSS)方法通常依赖类激活图(CAM)生成初始种子,但由于仅凭图像级标签的监督,往往难以捕捉全局上下文。为此,我们提出DALNet,即稠密对齐学习网络,利用文本嵌入来增强对不同粒度上物体的全面理解和精确定位。我们的关键洞察是采用双层对齐策略:(1)全局隐式对齐(GIA),通过最大化类标记与相应文本嵌入之间的相似度,同时最小化与背景嵌入的相似度,以捕捉全局语义;(2)局部显式对齐(LEA),利用补丁标记的空间信息来提高对象定位。此外,我们提出一种跨对比学习方法,在图像和文本模态之间的前景特征对齐,同时将其与背景分离,鼓励在遗漏区域激活,抑制干扰。通过在PASCAL VOC和MS COCO数据集上的大量实验,我们展示了DALNet显著优于当前最先进的WSSS方法。我们的做法尤其允许作为单阶段方法实现更高效的端到端过程。
引用
@article{arxiv.2409.15801,
title = {DIAL: Dense Image-text ALignment for Weakly Supervised Semantic Segmentation},
author = {Soojin Jang and Jungmin Yun and Junehyoung Kwon and Eunju Lee and Youngbin Kim},
journal= {arXiv preprint arXiv:2409.15801},
year = {2024}
}
备注
accepted by the European Conference on Computer Vision (ECCV), 2024