KernelWarehouse:面向参数高效动态卷积
摘要
动态卷积学习由样本相关注意力加权的 个静态核的线性混合,相比普通卷积表现出更优的性能。然而,现有设计参数效率低下:它们将卷积参数数量增加了 倍。这一点以及优化难度导致动态卷积领域没有研究进展能够让我们使用显著更大的 值(例如 而非典型设置 )来推进性能边界。本文提出 ,一种更通用的动态卷积形式,能够在参数效率与表征能力之间取得有利的权衡。其关键思想是从显著降低核维度并大幅增加核数量的角度,重新定义动态卷积中“核”与“组装核”的基本概念。原则上,KernelWarehouse 通过巧妙的核划分与仓库共享,增强同一层内及连续层之间的卷积参数依赖关系,从而高度自由地适配所需的参数预算。我们在 ImageNet 和 MS-COCO 数据集上基于不同 ConvNet 架构验证了我们的方法,并表明其达到了最先进的性能。例如,在 ImageNet 上使用 KernelWarehouse 训练的 ResNet18|ResNet50|MobileNetV2|ConvNeXt-Tiny 模型分别达到 76.05%|81.05%|75.52%|82.51% 的 top-1 准确率。得益于其灵活的设计,KernelWarehouse 甚至可以在提升准确率的同时减小 ConvNet 的模型尺寸,例如,我们的 ResNet18 模型相比基线分别减少 36.45%|65.10% 参数,同时 top-1 准确率绝对提升 2.89%|2.29%。
引用
@article{arxiv.2308.08361,
title = {KernelWarehouse: Towards Parameter-Efficient Dynamic Convolution},
author = {Chao Li and Anbang Yao},
journal= {arXiv preprint arXiv:2308.08361},
year = {2023}
}
备注
This research work was completed and submitted in early May 2023. Code and pre-trained models are available at https://github.com/OSVAI/KernelWarehouse