中文

面向整体视频识别的 Audio、Space 与 Time 跨注意力机制

计算机视觉与模式识别 2025-11-18 v2

摘要

我们提出了 Audio、Space 与 Time 跨注意力机制(CA^2ST),一种基于 transformer 的整体视频识别方法。视频中的动作识别需要空间和时间理解,但大多数现有模型缺乏对视频的平衡时空理解。为此,我们提出了一种新型双流体结构,称为 Space 和 Time 跨注意力(CAST),仅使用 RGB 输入。在 CAST 的每一层中,Bottleneck 跨注意力(B-CA)使空间专家和时间专家能够交换信息并进行协同预测。为了实现整体视频理解,我们通过集成音频专家,将 CAST 扩展为 Visual 和 Audio 跨注意力(CAVA)。我们在具有不同特征的基准上验证了 CAST,包括 EPIC-KITCHENS-100、Something-Something-V2 和 Kinetics-400,始终显示出平衡的性能。我们还在音频-视觉动作识别基准上验证了 CAVA,包括 UCF-101、VGG-Sound、KineticsSound 和 EPIC-SOUNDS。CAVA 在这些数据集上的优异性能表明,在 B-CA 模块中实现了多个专家之间有效的信息交换。总之,CA^2ST 将 CAST 和 CAVA 组合,通过跨注意力方式集成空间、时间和音频专家,实现了平衡和整体的视频理解。

关键词

引用

@article{arxiv.2503.23447,
  title  = {CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition},
  author = {Jongseo Lee and Joohyun Chang and Dongho Lee and Jinwoo Choi},
  journal= {arXiv preprint arXiv:2503.23447},
  year   = {2025}
}

备注

Our paper has been accepted to IEEE TPAMI