不同注意力机制在视频分类 3D 模型中的应用效果
计算机视觉与模式识别
2026-01-19 v1
摘要
由于应用范围广泛,人类动作识别已成为计算机视觉领域的重要研究热点。基于 3D ResNet 的 CNN 模型,特别是 MC3、R3D 和 R(2+1)D,使用不同的卷积滤波器来提取时空特征。本文研究了在提高帧分辨率的同时减少从时间数据中获取知识所产生的影响。为开展此实验,我们创建了与这三种原始设计类似的结构,但在最终分类器之前添加了 dropout 层。其次,我们为这三种设计中的每一种开发了十个新版本。这些变体在其架构中包含特殊的注意力模块,如卷积块注意力模块 (CBAM)、时间卷积网络 (TCN),以及多头和通道注意力机制。其目的是观察这些模块对受限时间模型的性能影响程度。在 UCF101 上测试所有模型的结果显示,在修改后的 R(2+1)D 中添加多头注意力的变体准确率达到 88.98%。本文总结了缺失的时间特征在新建的高分辨率模型性能中的重要性。尽管这些变体对整体性能的提升相似,但它们在类别级准确率上表现出不同的行为。
引用
@article{arxiv.2601.10854,
title = {Effects of Different Attention Mechanisms Applied on 3D Models in Video Classification},
author = {Mohammad Rasras and Iuliana Marin and Serban Radu and Irina Mocanu},
journal= {arXiv preprint arXiv:2601.10854},
year = {2026}
}
备注
18 pages, 6 figures, conference