结合3D CNN和Transformer的视频行为识别框架
计算机视觉与模式识别
2025-08-12 v1 人工智能
摘要
视频行为识别是公共安全、智能监视和人机交互等领域的关键技术。传统3D卷积神经网络(3D CNN)有效捕获局部时空特征,但在建模长程依赖方面存在挑战。相反,Transformer在学习全局上下文信息方面表现出色,但面临高计算成本的挑战。为此,我们提出一种结合3D CNN和Transformer架构的混合框架。3D CNN模块提取低级时空特征,而Transformer模块捕获长程时间依赖,两者通过融合机制集成表示。在基准数据集上评估,所提模型超越传统3D CNN和独立Transformer,实现更高的识别准确率且复杂度可控。消融研究进一步验证了两种模块的互补优势。该混合框架为视频行为识别提供了有效且可扩展的解决方案。
关键词
引用
@article{arxiv.2508.06528,
title = {A Framework Combining 3D CNN and Transformer for Video-Based Behavior Recognition},
author = {Xiuliang Zhang and Tadiwa Elisha Nyamasvisva and Chuntao Liu},
journal= {arXiv preprint arXiv:2508.06528},
year = {2025}
}
备注
9 pages,6 figures