面向弱监督语义分割的图像增强代理
计算机视觉与模式识别
2025-08-26 v4
摘要
弱监督语义分割(WSSS)仅依赖图像级标签便已取得显著进展。然而,现有方法多聚焦于设计新型网络结构与损失函数,以生成更精准的稠密标签,忽视了固定数据集所施加的限制,可能制约性能进一步提升。我们认为,提供更加多样化的可训练图像能为WSSS提供更丰富的信息,帮助模型更全面地理解语义模式。因此,本文引入了一种新方法——图像增强代理(Image Augmentation Agent, IAA),证明了从数据生成角度增强WSSS是可行的。IAA主要设计了一个增强代理,利用大语言模型(LLM)和扩散模型自动生成额外的WSSS图像。实际应用中,为解决LLM在提示生成过程中的不稳定性,我们开发了提示自细化机制,使其能够重新评估生成提示的合理性,从而产生更连贯的提示。此外,我们在扩散生成过程中插入在线过滤器,以动态确保生成图像的质量与平衡性。实验结果表明,我们的方法在PASCAL VOC 2012和MS COCO 2014数据集上显著超越当前最先进的WSSS方法。
关键词
引用
@article{arxiv.2412.20439,
title = {Image Augmentation Agent for Weakly Supervised Semantic Segmentation},
author = {Wangyu Wu and Xianglin Qiu and Siqi Song and Zhenhong Chen and Xiaowei Huang and Fei Ma and Jimin Xiao},
journal= {arXiv preprint arXiv:2412.20439},
year = {2025}
}
备注
Accepted at Neurocomputing 2025