中文

Video RWKV:基于 RWKV 的视频动作识别

计算机视觉与模式识别 2024-11-11 v1 机器学习

摘要

为应对现有视频理解方法(如 CNN 和 Transformer)计算成本高和长距离依赖的挑战,本工作以新颖方式将 RWKV 引入视频领域。我们提出了一种 LSTM CrossRWKV(LCR)框架,旨在进行时空表征学习以应对视频理解任务。具体而言,所提出的线性复杂度 LCR 包含一种新颖的 Cross RWKV 门,以促进当前帧边缘信息与过去特征之间的交互,通过边缘特征增强对主体的关注,并随时间全局聚合帧间特征。LCR 通过增强的 LSTM 循环执行机制存储视频处理的长期记忆。通过利用 Cross RWKV 门和循环执行,LCR 有效捕捉了空间和时间特征。此外,边缘信息充当 LSTM 的遗忘门,引导长期记忆管理。Tube masking 策略减少了食物中的冗余信息并降低了过拟合。这些优势使 LSTM CrossRWKV 在视频理解方面树立了新基准,为全面视频分析提供了可扩展且高效的解决方案。所有代码和模型均公开可用。

关键词

引用

@article{arxiv.2411.05636,
  title  = {Video RWKV:Video Action Recognition Based RWKV},
  author = {Zhuowen Yin and Chengru Li and Xingbo Dong},
  journal= {arXiv preprint arXiv:2411.05636},
  year   = {2024}
}