用于语义分割的频率自适应空洞卷积
计算机视觉与模式识别
2025-06-10 v7
摘要
空洞卷积通过在其连续元素之间插入间隙来扩大感受野,被广泛应用于计算机视觉领域。在本研究中,我们从频谱分析的角度提出了三种策略来改进空洞卷积的各个阶段。不同于将全局空洞率固定为超参数的传统做法,我们引入了频率自适应空洞卷积(FADC),该方法根据局部频率分量在空间上动态调整空洞率。随后,我们设计了两个即插即用模块以直接增强有效带宽和感受野大小。自适应核(AdaKern)模块将卷积权重分解为低频和高频分量,并在逐通道基础上动态调整这些分量之间的比例。通过增加卷积权重的高频部分,AdaKern 能够捕获更多高频分量,从而提高有效带宽。频率选择(FreqSelect)模块通过空间变化的重加权,在特征表示中最佳地平衡高频和低频分量。它抑制背景中的高频以鼓励 FADC 学习更大的空洞,从而扩大感受野以覆盖更广的范围。在分割和目标检测任务上的大量实验一致验证了我们方法的有效性。代码已公开:https://github.com/Linwei-Chen/FADC。
引用
@article{arxiv.2403.05369,
title = {Frequency-Adaptive Dilated Convolution for Semantic Segmentation},
author = {Linwei Chen and Lin Gu and Ying Fu},
journal= {arXiv preprint arXiv:2403.05369},
year = {2025}
}
备注
CVPR 2024 highlighted