动态 Mobile-Former:在核空间以注意力与残差连接增强动态卷积
计算机视觉与模式识别
2023-04-17 v1
摘要
我们提出动态 Mobile-Former (DMF),通过将其与高效算子相协调来最大化动态卷积的能力。我们的动态 MobileFormer 有效利用动态 MobileNet(配备动态卷积的 MobileNet)的优势,并使用来自轻量级注意力的全局信息。动态 Mobile-Former 中的 Transformer 仅需少量随机初始化的 token 来计算全局特征,使其计算高效。并且 Dynamic MobileNet 与 Transformer 之间的桥梁实现了局部与全局特征的双向融合。我们还通过将卷积核拆分为输入无关核与输入相关核,简化了原始动态卷积的优化过程。这使得在更宽的核空间中进行优化,从而增强容量。通过集成轻量级注意力与增强的动态卷积,我们的动态 Mobile-Former 不仅实现了高效率,也具备强劲性能。我们在一系列视觉任务上基准测试了动态 Mobile-Former,并展示其在图像分类、COCO 检测与实例分割上取得了令人印象深刻的性能。例如,我们的 DMF 在 ImageNet-1K 上达到 79.4% 的 top-1 准确率,比 PVT-Tiny 高 4.3%,且仅用其 1/4 的 FLOPs。此外,我们提出的 DMF-S 模型在 COCO 等具挑战性的视觉数据集上表现良好,实现了 39.0% 的 mAP,比 Mobile-Former 508M 模型高 1%,尽管少用了 3 GFLOPs 的计算量。代码与模型可在 https://github.com/ysj9909/DMF 获取。
引用
@article{arxiv.2304.07254,
title = {Dynamic Mobile-Former: Strengthening Dynamic Convolution with Attention and Residual Connection in Kernel Space},
author = {Seokju Yun and Youngmin Ro},
journal= {arXiv preprint arXiv:2304.07254},
year = {2023}
}
备注
11 pages, 3 figures, 8 tables