MorphMLP:一种面向时空表示学习的高效类MLP骨干网络
计算机视觉与模式识别
2022-08-24 v3
摘要
近年来,类MLP网络在图像识别领域重新兴起。然而,由于复杂的时空建模伴随巨大的计算负担,能否在视频领域构建通用的类MLP架构尚未被探索。为填补这一空白,我们提出了一种高效的无自注意力骨干网络,即MorphMLP,它灵活地利用简洁的全连接(FC)层进行视频表示学习。具体而言,一个MorphMLP块由两个依次排列的关键层组成,即MorphFC_s和MorphFC_t,分别用于空间和时间建模。MorphFC_s通过沿高度和宽度维度逐步进行令牌交互,能够有效捕获每帧中的核心语义。而MorphFC_t则通过对每个空间位置上的时间令牌聚合,自适应地学习帧间的长期依赖关系。凭借这种多维度、多尺度的分解,我们的MorphMLP块实现了优异的精度-计算平衡。最后,我们在多个流行的视频基准上评估了MorphMLP。与近期最先进的模型相比,MorphMLP显著降低了计算量,同时获得了更好的精度,例如,在ImageNet1K预训练下,MorphMLP-S仅使用VideoSwin-T 50%的GFLOPs,便在Kinetics400上取得了0.9%的top-1提升。MorphMLP-B仅使用MViT-B 43%的GFLOPs,便在SSV2上取得了2.4%的top-1提升,尽管MorphMLP-B是在ImageNet1K上预训练的,而MViT-B是在Kinetics400上预训练的。此外,我们的方法迁移至图像领域后,性能优于先前最先进的类MLP架构。代码已开源:https://github.com/MTLab/MorphMLP。
引用
@article{arxiv.2111.12527,
title = {MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning},
author = {David Junhao Zhang and Kunchang Li and Yali Wang and Yunpeng Chen and Shashwat Chandra and Yu Qiao and Luoqi Liu and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2111.12527},
year = {2022}
}
备注
ECCV2022