中文

基于运动增强的注意力跨模态交互的压缩视频动作识别表示学习

计算机视觉与模式识别 2025-10-06 v3 人工智能

摘要

压缩视频动作识别近期受到越来越多的关注,因其通过以稀疏采样的RGB帧与压缩运动线索(如运动向量与残差)替代原始视频,显著降低了存储与计算成本。然而该任务深受粗噪动态以及异质RGB与运动模态融合不足之困。为解决上述两方面问题,本文提出一种新颖框架,即带运动增强的注意力跨模态交互网络(MEACI-Net)。其遵循双流架构,即一支用于RGB模态,另一支用于运动模态。特别地,运动流采用嵌入去噪模块的多尺度块以增强表示学习。随后通过引入选择性运动补充(SMC)与跨模态增强(CMA)模块强化两流间交互,其中SMC以时空注意力局部运动特征补充RGB模态,CMA进一步通过选择性特征增强结合两模态。在UCF-101、HMDB-51与Kinetics-400基准上的大量实验证明了MEACI-Net的有效性与高效性。

关键词

引用

@article{arxiv.2205.03569,
  title  = {Representation Learning for Compressed Video Action Recognition via Attentive Cross-modal Interaction with Motion Enhancement},
  author = {Bing Li and Jiaxin Chen and Dongming Zhang and Xiuguo Bao and Di Huang},
  journal= {arXiv preprint arXiv:2205.03569},
  year   = {2025}
}

备注

Accepted to IJCAI 2022