中文

AFANet:用于弱监督少样本语义分割的自适应频率感知网络

计算机视觉与模式识别 2024-12-30 v2 人工智能

摘要

少样本学习旨在通过利用从少量样本中学习到的先验知识来识别新概念。然而,对于视觉密集型任务,如少样本语义分割,像素级标注需要大量时间和成本。因此,本文我们利用更具挑战性的图像级标注,提出一种自适应频率感知网络(AFANet)用于弱监督少样本语义分割(WFSS)。具体而言,我们首先提出一种跨粒度频率感知模块(CFM),将RGB图像解耦为高频和低频分布,并通过重新对齐它们来进一步优化语义结构信息。与大多数现有WFSS方法使用来自多模态语言-视觉模型(如CLIP)的文本信息(以离线学习方式)不同,我们进一步提出一种CLIP引导的空间适配器模块(CSM),通过在线学习对文本信息执行空间域自适应变换,从而为CFM提供更丰富的跨模态语义信息。在Pascal-5^i和COCO-20^i数据集上的大量实验表明,AFANet已实现最先进的性能。代码可在 https://github.com/jarch-ma/AFANet 获取。

关键词

引用

@article{arxiv.2412.17601,
  title  = {AFANet: Adaptive Frequency-Aware Network for Weakly-Supervised Few-Shot Semantic Segmentation},
  author = {Jiaqi Ma and Guo-Sen Xie and Fang Zhao and Zechao Li},
  journal= {arXiv preprint arXiv:2412.17601},
  year   = {2024}
}

备注

Accepted by TMM 2024