长期跳跃注意力与短期周期移位用于视频分类
计算机视觉与模式识别
2022-07-26 v2 多媒体
摘要
视频 transformer 自然比静态视觉 transformer 带来更重的计算负担,因为前者在当前二次复杂度 的注意力下处理比后者长 倍的序列。现有工作将时间轴视为空间轴的简单扩展,侧重于通过通用池化或局部窗口化来缩短时空序列,而未利用时间冗余。然而,视频在相邻帧之间自然包含冗余信息;因此,我们可能以膨胀的方式抑制对视觉相似帧的注意力。基于该假设,我们提出 LAPS,一种用于视频 transformer 的长期“跳跃注意力”(LA)、短期“周期移位”(P-Shift)模块,其复杂度为 。具体而言,“LA”将长期帧分组为对,然后通过注意力重构每个离散对。“P-Shift”在时间邻居之间交换特征以应对短期动态的丢失。通过将朴素 2D 注意力替换为 LAPS,我们可以将静态 transformer 适配为视频 transformer,且零额外参数与可忽略的计算开销(约 2.6%)。在标准 Kinetics-400 基准上的实验表明,我们的 LAPS transformer 在准确率、FLOPs 和参数量方面可在 CNN 与 transformer 的 SOTA 方法中取得有竞争力的性能。我们在 \sloppy \href{https://github.com/VideoNetworks/LAPS-transformer}{\textit{\color{magenta}{https://github.com/VideoNetworks/LAPS-transformer}}} 开源了我们的项目。
引用
@article{arxiv.2207.05526,
title = {Long-term Leap Attention, Short-term Periodic Shift for Video Classification},
author = {Hao Zhang and Lechao Cheng and Yanbin Hao and Chong-Wah Ngo},
journal= {arXiv preprint arXiv:2207.05526},
year = {2022}
}
备注
Accepted by ACM Multimedia 2022, 10 pages, 4 figures