KernelWarehouse: 重构动态卷积的设计
摘要
动态卷积学习输入依赖注意力加权的 n 个静态 kernel 的线性混合,性能优于普通卷积。然而,它会将卷积参数增加 n 倍,因而在参数效率方面不具竞争力。这导致没有研究能够允许研究者探索 n>100(远高于典型设置 n<10)的 setting,以在保持参数效率的同时推动动态卷积性能边界。为填补这一空白,本文提出 KernelWarehouse,这是一种更通用形式的动态卷积,通过重新定义“kernel”、“assemble kernels”和“attention function”等基本概念,基于在同一卷积层以及相邻卷积层之间利用卷积参数依赖性来实现。我们在 ImageNet 和 MS-COCO 数据集上使用 various ConvNet 架构测试了 KernelWarehouse 的有效性。值得注意的是,KernelWarehouse 也可用于 Vision Transformer,并且即使在保持模型大小的同时,仍能提高模型准确率。例如,KernelWarehouse (n=4) 在 ResNet18|MobileNetV2|DeiT-Tiny backbone 上分别实现了 5.61%|3.90%|4.38% 的绝对 top-1 准确率提升;而 KernelWarehouse (n=1/4) 虽仅减少 65.10% 的模型规模,却仍实现了 2.29% 的提升。代码和模型已在 GitHub 上提供:https://github.com/OSVAI/KernelWarehouse。
引用
@article{arxiv.2406.07879,
title = {KernelWarehouse: Rethinking the Design of Dynamic Convolution},
author = {Chao Li and Anbang Yao},
journal= {arXiv preprint arXiv:2406.07879},
year = {2024}
}
备注
This work is accepted to ICML 2024. The project page: https://github.com/OSVAI/KernelWarehouse. arXiv admin note: substantial text overlap with arXiv:2308.08361