全维度动态卷积
计算机视觉与模式识别
2022-09-19 v1 人工智能
机器学习
摘要
在每个卷积层中学习单一的静态卷积核是现代卷积神经网络(CNN)的通用训练范式。相反,近期关于动态卷积的研究表明,学习 个卷积核的线性组合并以输入依赖的注意力加权,可在保持高效推理的同时显著提升轻量型 CNN 的准确率。然而,我们观察到已有工作仅通过核空间的一个维度(关于卷积核数量)赋予卷积核动态特性,而其余三个维度(关于每个卷积核的空间尺寸、输入通道数和输出通道数)被忽视。受此启发,我们提出全维度动态卷积(ODConv),一种更通用且优雅的动态卷积设计,以推进该方向研究。ODConv 利用一种新颖的多维注意力机制与并行策略,在任意卷积层沿核空间全部四个维度为卷积核学习互补注意力。作为常规卷积的直接替换,ODConv 可插入多种 CNN 架构。在 ImageNet 和 MS-COCO 数据集上的大量实验表明,ODConv 为包括轻量型和大型在内的多种主流 CNN 骨干网络带来稳固的准确率提升,例如,在 ImageNet 数据集上为 MobileNetV2|ResNet 系列带来 3.77%~5.71%|1.86%~3.72% 的绝对 top-1 提升。有趣的是,得益于其改进的特征学习能力,即便仅有一个卷积核的 ODConv 也能媲美或超越具有多个卷积核的现有动态卷积方案,大幅减少额外参数。此外,ODConv 在调制输出特征或卷积权重方面也优于其他注意力模块。
引用
@article{arxiv.2209.07947,
title = {Omni-Dimensional Dynamic Convolution},
author = {Chao Li and Aojun Zhou and Anbang Yao},
journal= {arXiv preprint arXiv:2209.07947},
year = {2022}
}
备注
Spotlight paper at ICLR 2022. Code and models are available at https://github.com/OSVAI/ODConv