MLP-3D:一种带分组时间混合的类 MLP 三维架构
计算机视觉与模式识别
2022-06-14 v1 人工智能
多媒体
摘要
卷积神经网络(CNNs)一直被视为视觉识别的首选模型。近来,基于多头自注意力(MSA)或多层感知机(MLPs)的无卷积网络愈发流行。然而,由于视频数据的大幅变化与复杂性,将这些新兴网络用于视频识别并非易事。本文提出 MLP-3D 网络,一种用于视频识别的新型类 MLP 三维架构。具体而言,该架构由 MLP-3D 块组成,每个块包含一个跨 token 应用的 MLP(即 token 混合 MLP)和一个独立应用于每个 token 的 MLP(即通道 MLP)。通过推导新颖的分组时间混合(GTM)操作,我们赋予基础 token 混合 MLP 时间建模能力。GTM 将输入 token 划分为若干时间组,并用共享投影矩阵对各组内 token 进行线性映射。此外,我们设计了具有不同分组策略的若干 GTM 变体,并通过贪心架构搜索将各变体组合于 MLP-3D 网络的不同块中。在不依赖卷积或注意力机制的情况下,我们的 MLP-3D 网络在 Something-Something V2 与 Kinetics-400 数据集上分别取得 68.5\%/81.4\% 的 top-1 准确率。尽管计算量更少,结果仍可媲美最先进常用 3D CNNs 与视频 transformers。源代码发布于 https://github.com/ZhaofanQiu/MLP-3D。
引用
@article{arxiv.2206.06292,
title = {MLP-3D: A MLP-like 3D Architecture with Grouped Time Mixing},
author = {Zhaofan Qiu and Ting Yao and Chong-Wah Ngo and Tao Mei},
journal= {arXiv preprint arXiv:2206.06292},
year = {2022}
}
备注
CVPR 2022; Code is publicly available at: https://github.com/ZhaofanQiu/MLP-3D