中文

基于频率的动态卷积用于稠密图像预测

计算机视觉与模式识别 2025-03-26 v2 人工智能

摘要

虽然动态卷积(DY-Conv)通过启用多个平行权重结合注意力机制来实现自适应权重选择,显示出有前景的性能,但这些权重的频率响应倾向于 exhibit high similarity,导致高参数成本但 limited adaptability。本文引入了频率动态卷积(FDConv),一种 novel method,通过在傅里叶域学习固定的参数预算来缓解这些限制。FDConv 将该预算划分为具有 disjoint Fourier indices的频率-based groups,从而在不增加参数成本的情况下构建 frequency-diverse weights。为了进一步增强适应性,我们提出了 Kernel Spatial Modulation(KSM)和 Frequency Band Modulation(FBM)。KSM 在空间水平上动态调整每个 filter 的频率响应,而 FBM 将权重分解为频率域中的 distinct frequency bands,并根据 local content 动态调制它们。在对象检测、分割和分类上的 extensive experiments表明,FDConv的有效性。我们展示,当应用于 ResNet-50 时,FDConv 在 modest increase of +3.6M parameters的基础上实现了 superior performance,超越需要大量增加参数预算的方法(例如 CondConv +90M,KW +76.5M)。此外,FDConv seamlessly integrates into various architectures,包括 ConvNeXt、Swin-Transformer,为现代视觉任务提供了一个 flexible and efficient solution。该代码已公开发布于 https://github.com/Linwei-Chen/FDConv。

关键词

引用

@article{arxiv.2503.18783,
  title  = {Frequency Dynamic Convolution for Dense Image Prediction},
  author = {Linwei Chen and Lin Gu and Liang Li and Chenggang Yan and Ying Fu},
  journal= {arXiv preprint arXiv:2503.18783},
  year   = {2025}
}

备注

Accepted by CVPR 2025