高效可变形卷积网络:重新思考视觉应用中的动态与稀疏算子
计算机视觉与模式识别
2024-01-15 v1
摘要
我们引入了 Deformable Convolution v4 (DCNv4),这是一种为广泛视觉应用设计的高效且有效的算子。DCNv4 通过两项关键改进解决了其前身 DCNv3 的局限性:1. 移除空间聚合中的 softmax 归一化,以增强其动态特性和表达能力;2. 优化内存访问以减少冗余操作从而加速。这些改进使得其收敛速度相比 DCNv3 显著加快,处理速度大幅提升,DCNv4 的前向速度达到了三倍以上。DCNv4 在包括图像分类、实例分割和语义分割,以及显著地在图像生成在内的各种任务中表现出色。当将其集成到潜在扩散模型中 U-Net 等生成模型时,DCNv4 优于其基线,凸显了其增强生成模型的潜力。在实际应用中,将 InternImage 模型中的 DCNv3 替换为 DCNv4 以构建 FlashInternImage,在无需进一步修改的情况下实现了高达 80% 的速度提升和进一步的性能改善。DCNv4 在速度和效率上的进步,结合其在多样化视觉任务中的稳健性能,展示了其作为未来视觉模型基础构建模块的潜力。
引用
@article{arxiv.2401.06197,
title = {Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications},
author = {Yuwen Xiong and Zhiqi Li and Yuntao Chen and Feng Wang and Xizhou Zhu and Jiapeng Luo and Wenhai Wang and Tong Lu and Hongsheng Li and Yu Qiao and Lewei Lu and Jie Zhou and Jifeng Dai},
journal= {arXiv preprint arXiv:2401.06197},
year = {2024}
}
备注
Tech report; Code: https://github.com/OpenGVLab/DCNv4