HorNet:基于递归门控卷积的高效高阶空间交互
计算机视觉与模式识别
2022-10-12 v3
摘要
视觉 Transformer 的最新进展在各种任务中取得了巨大成功,其驱动力是基于点积自注意力的新型空间建模机制。本文中,我们表明视觉 Transformer 背后的关键要素,即输入自适应、长程与高阶空间交互,也可以由基于卷积的框架高效实现。我们提出递归门控卷积(Conv),它通过门控卷积与递归设计实现高阶空间交互。该新操作高度灵活且可定制,兼容多种卷积变体,并将自注意力中的二阶交互扩展到任意阶而不引入显著的额外计算。Conv 可作为即插即用模块用于改进各类视觉 Transformer 与基于卷积的模型。基于该操作,我们构建了一个名为 HorNet 的通用视觉骨干网络新族。在 ImageNet 分类、COCO 目标检测与 ADE20K 语义分割上的大量实验表明,在相似整体架构与训练配置下,HorNet 显著优于 Swin Transformers 与 ConvNeXt。HorNet 还对更多训练数据与更大模型规模表现出良好的可扩展性。除在视觉编码器中的有效性外,我们还展示了 Conv 可应用于任务特定的解码器,并以更少计算一致地提升密集预测性能。我们的结果表明 Conv 可成为视觉建模的新基本模块,有效结合视觉 Transformer 与 CNN 的优点。代码见 https://github.com/raoyongming/HorNet
引用
@article{arxiv.2207.14284,
title = {HorNet: Efficient High-Order Spatial Interactions with Recursive Gated Convolutions},
author = {Yongming Rao and Wenliang Zhao and Yansong Tang and Jie Zhou and Ser-Nam Lim and Jiwen Lu},
journal= {arXiv preprint arXiv:2207.14284},
year = {2022}
}
备注
project page: https://hornet.ivg-research.xyz