面向视频动作识别的对齐引导时序注意力
计算机视觉与模式识别
2023-01-03 v2
摘要
时序建模对于各类视频学习任务至关重要。近期大多数方法采用分解式(2D+1D)或联合式(3D)时空操作来从输入帧中提取时序上下文。前者计算更高效,后者通常性能更好。在本文中,我们将此归因于不同帧中各个位置之间交互的充分性与效率难以兼顾的困境。这些交互影响了帧间共享的任务相关信息的提取。为解决该问题,我们证明逐帧对齐有潜力增加帧表示之间的互信息,从而纳入更多任务相关信息以提升效果。随后我们提出对齐引导时序注意力(Alignment-guided Temporal Attention, ATA),通过相邻帧间无参数的块级对齐来扩展一维时序注意力。它可作为通用插件用于图像骨干网络以执行动作识别任务,无需任何模型特定设计。在多个基准上的大量实验证明了我们模块的优越性与通用性。
引用
@article{arxiv.2210.00132,
title = {Alignment-guided Temporal Attention for Video Action Recognition},
author = {Yizhou Zhao and Zhenyang Li and Xun Guo and Yan Lu},
journal= {arXiv preprint arXiv:2210.00132},
year = {2023}
}
备注
Accepted by NeurIPS 2022