中文

结合3D CNN和Transformer的视频行为识别框架

计算机视觉与模式识别 2025-08-12 v1 人工智能

摘要

视频行为识别是公共安全、智能监视和人机交互等领域的关键技术。传统3D卷积神经网络(3D CNN)有效捕获局部时空特征,但在建模长程依赖方面存在挑战。相反,Transformer在学习全局上下文信息方面表现出色,但面临高计算成本的挑战。为此,我们提出一种结合3D CNN和Transformer架构的混合框架。3D CNN模块提取低级时空特征,而Transformer模块捕获长程时间依赖,两者通过融合机制集成表示。在基准数据集上评估,所提模型超越传统3D CNN和独立Transformer,实现更高的识别准确率且复杂度可控。消融研究进一步验证了两种模块的互补优势。该混合框架为视频行为识别提供了有效且可扩展的解决方案。

关键词

引用

@article{arxiv.2508.06528,
  title  = {A Framework Combining 3D CNN and Transformer for Video-Based Behavior Recognition},
  author = {Xiuliang Zhang and Tadiwa Elisha Nyamasvisva and Chuntao Liu},
  journal= {arXiv preprint arXiv:2508.06528},
  year   = {2025}
}

备注

9 pages,6 figures