面向视觉网络的高效调制
计算机视觉与模式识别
2024-04-01 v1
摘要
在这项工作中,我们提出了高效调制(efficient modulation),一种用于高效视觉网络的新颖设计。我们重新审视了调制机制,该机制通过卷积上下文建模和特征投影层处理输入,并通过逐元素乘法和MLP块融合特征。我们证明了调制机制特别适合高效网络,并通过提出高效调制(EfficientMod)块进一步定制了调制设计,该块被视为我们网络的基本构建块。得益于调制机制卓越的表示能力和我们提出的高效设计,我们的网络能够在准确性和效率之间实现更好的权衡,并在高效网络动物园中树立了新的最先进性能。当将EfficientMod与普通自注意力块集成时,我们获得了混合架构,该架构在不损失效率的情况下进一步提升了性能。我们进行了全面的实验来验证EfficientMod的性能。在参数更少的情况下,我们的EfficientMod-s的top-1准确率比EfficientFormerV2-s2高0.6%,在GPU上快25%,并且在相同GPU延迟下比MobileViTv2-1.0高2.9%。此外,我们的方法在下游任务中表现出显著改进,在ADE20K基准测试上比EfficientFormerV2-s高出3.6 mIoU。代码和检查点可在https://github.com/ma-xu/EfficientMod获取。
引用
@article{arxiv.2403.19963,
title = {Efficient Modulation for Vision Networks},
author = {Xu Ma and Xiyang Dai and Jianwei Yang and Bin Xiao and Yinpeng Chen and Yun Fu and Lu Yuan},
journal= {arXiv preprint arXiv:2403.19963},
year = {2024}
}
备注
Accepted by ICLR 2024. Codes are made publically available at https://github.com/ma-xu/EfficientMod