中文

面向视频动作识别的异构双流框架与比较性融合分析

计算机视觉与模式识别 2026-04-28 v1

摘要

大多数双流动作识别网络对 RGB 和光流流分别应用相同的卷积骨干网络,忽视了两种模态在结构上的根本不同。光流捕捉细粒度运动模式,而 RGB 帧携带丰富的外观和场景上下文——对它们采用相同处理方式则弃置了这种区别。我们提出 DualStreamHybrid,一种异构双流架构,为每条流分配适合其输入的骨干网络:为 RGB 帧使用预训练的 ViT-Tiny/16,为 20 通道堆叠的光流表示从头训练的 MobileNetV2。一个学习到的投影层将两种不同尺寸的特征向量映射到统一维度,以实现融合,同时无需强制架构对称性。我们在统一框架内设计了五种融合策略——晚期融合、拼接、交叉注意力、加权融合和门控融合——并在 UCF11(1,600 个视频,11 类)和 UCF50(6,681 个视频,50 类)上进行评估,以研究融合行为随数据集规模的变化。 在 UCF11 上,交叉注意力实现了 98.12% 的测试准确率,优于仅使用 RGB 的 ViT-Tiny 基线的 95.94%,这表明在较小规模的、较不复杂的数据集上,显式的跨模态注意力尤其有效。在 UCF50 上,加权融合达到 96.86%,并在两个基准测试中表现最一致。所学得的流权重揭示了有趣的模式:UCF11 看到近乎相等的模态贡献(RGB: 0.507,flow: 0.493),而 UCF50 对 RGB 流略显倾向(RGB: 0.554,flow: 0.446)——这或反映了更大规模和更丰富的动作空间。综上,这些结果表明,即使是一个轻量级的运动流在强大的外观编码器那里具有意义的补充作用,最佳融合策略取决于数据集规模。

关键词

引用

@article{arxiv.2604.23415,
  title  = {A Heterogeneous Two-Stream Framework for Video Action Recognition with Comparative Fusion Analysis},
  author = {Md. Afzalur Rahaman and Tahmid Rahman},
  journal= {arXiv preprint arXiv:2604.23415},
  year   = {2026}
}

备注

17 pages, 8 figures