中文

基于 CLIP 的零样本动作识别多模态时空专家构建

计算机视觉与模式识别 2025-02-11 v2

摘要

零样本动作识别(ZSAR)需要多模态时空理解的协同工作。然而,直接对 ZSAR 进行微调会导致性能不佳,因为其在捕捉来自视觉和文本两个维度的关键时序动态方面存在固有限制,尤其是在遇到时空差异细粒度的新型动作时。本文提出了一种基于 CLIP 的新颖框架——时空动态组合(Spatiotemporal Dynamic Duo, STDD),用于协同理解多模态时空动态。对于视觉侧,我们提出了一种高效的时空交叉注意力机制,通过在空间注意力前后应用简单而有效的操作来灵活地捕捉时空动态,既无需额外参数,又不增加计算复杂度。对于语义侧,我们通过全面构建动作语义知识图(ASKG)来进行时空文本增强,旨在从细微的文本提示中派生时空信息。ASKG基于将动作分解为空间外观和时间运动的思想,阐述了静态概念和动态概念及其相互关系。在训练阶段,帧级视频表示与提示级细致文本表示进行精心对齐,这些文本表示同时受到来自冻结 CLIP 的视频表示的约束,以增强泛化性。大量实验验证了我们方法的有效性,该方法在挑战性的 ZSAR 设置下, consistently 超过当今最先进的方法,在流行的视频基准测试(即 Kinetics-600、UCF101 和 HMDB51)上表现优异。

关键词

引用

@article{arxiv.2412.09895,
  title  = {Building a Multi-modal Spatiotemporal Expert for Zero-shot Action Recognition with CLIP},
  author = {Yating Yu and Congqi Cao and Yueran Zhang and Qinyi Lv and Lingtong Min and Yanning Zhang},
  journal= {arXiv preprint arXiv:2412.09895},
  year   = {2025}
}

备注

Accepted by AAAI 2025