中文

面向弱监督语义分割的图像增强代理

计算机视觉与模式识别 2025-08-26 v4

摘要

弱监督语义分割(WSSS)仅依赖图像级标签便已取得显著进展。然而,现有方法多聚焦于设计新型网络结构与损失函数,以生成更精准的稠密标签,忽视了固定数据集所施加的限制,可能制约性能进一步提升。我们认为,提供更加多样化的可训练图像能为WSSS提供更丰富的信息,帮助模型更全面地理解语义模式。因此,本文引入了一种新方法——图像增强代理(Image Augmentation Agent, IAA),证明了从数据生成角度增强WSSS是可行的。IAA主要设计了一个增强代理,利用大语言模型(LLM)和扩散模型自动生成额外的WSSS图像。实际应用中,为解决LLM在提示生成过程中的不稳定性,我们开发了提示自细化机制,使其能够重新评估生成提示的合理性,从而产生更连贯的提示。此外,我们在扩散生成过程中插入在线过滤器,以动态确保生成图像的质量与平衡性。实验结果表明,我们的方法在PASCAL VOC 2012和MS COCO 2014数据集上显著超越当前最先进的WSSS方法。

关键词

引用

@article{arxiv.2412.20439,
  title  = {Image Augmentation Agent for Weakly Supervised Semantic Segmentation},
  author = {Wangyu Wu and Xianglin Qiu and Siqi Song and Zhenhong Chen and Xiaowei Huang and Fei Ma and Jimin Xiao},
  journal= {arXiv preprint arXiv:2412.20439},
  year   = {2025}
}

备注

Accepted at Neurocomputing 2025