DVFL-Net:用于时空动作识别的轻量化蒸馏视频焦点调制网络
计算机视觉与模式识别
2025-07-21 v2
摘要
视频识别领域已显著演进,从传统卷积神经网络(CNN)转向基于Transformer的架构以提升准确率。虽然3D CNN在捕捉时空动力学方面效果良好,但近期Transformer模型利用自注意力机制建模长程时空依赖。尽管在主要基准测试上取得领先性能,Transformer仍因密集视频数据计算开销较大。为此,本文提出轻量化视频焦点调制网络DVFL-Net,通过从大型预训练教师模型蒸馏时空知识到紧凑的纳米学生模型,实现高效的设备端部署。DVFL-Net运用知识蒸馏和时空特征调制显著降低计算复杂度,同时保持高识别性能。采用前向Kullback-Leibler(KL)散度配合时空焦点调制,有效传递Video-FocalNet Base(教师)至DVFL-Net(学生)中的局部与全局上下文。我们在UCF50、UCF101、HMDB51、SSV2和Kinetics-400上评估DVFL-Net,对比最新SOTA方法,进行人类动作识别(HAR)。此外,详尽的消融研究分析前向KL散度影响。结果表明DVFL-Net在性能与效率间达到最佳平衡,显示更低内存占用、减少GFLOPs及强准确率,为实时HAR应用提供实用方案。
引用
@article{arxiv.2507.12426,
title = {DVFL-Net: A Lightweight Distilled Video Focal Modulation Network for Spatio-Temporal Action Recognition},
author = {Hayat Ullah and Muhammad Ali Shafique and Abbas Khan and Arslan Munir},
journal= {arXiv preprint arXiv:2507.12426},
year = {2025}
}
备注
17 pages