中文

用于音视频零样本学习的多时间尺度运动解耦脉冲 Transformer

计算机视觉与模式识别 2025-05-27 v1

摘要

音视频零样本学习(ZSL)因其在训练期间能够对来自未见类别的视频数据进行分类的能力而受到广泛研究。然而,当前方法常常难以应对背景场景偏差和运动细节不足的问题。本文提出了一种新颖的双流多时间尺度运动解耦脉冲 Transformer(MDST++),它将上下文语义信息与稀疏动态运动信息解耦。我们提出了循环联合学习单元,以提取上下文语义信息并捕获跨各种模态的联合知识,从而理解动作发生的环境。通过将 RGB 图像转换为事件,我们的方法更准确地捕获运动信息并减轻了背景场景偏差。此外,我们引入了差异分析块来对音频运动信息进行建模。为了增强 SNN 在提取时间和运动线索方面的鲁棒性,我们基于全局运动和上下文语义信息动态调整 Leaky Integrate-and-Fire 神经元的阈值。我们的实验验证了 MDST++ 的有效性,证明了其在主流基准上相对于 SOTA 方法的一致优越性。此外,结合运动和多时间尺度信息使 HM 和 ZSL 准确率分别显著提升了 26.2% 和 39.9%。

关键词

引用

@article{arxiv.2505.19938,
  title  = {Multi-Timescale Motion-Decoupled Spiking Transformer for Audio-Visual Zero-Shot Learning},
  author = {Wenrui Li and Penghong Wang and Xingtao Wang and Wangmeng Zuo and Xiaopeng Fan and Yonghong Tian},
  journal= {arXiv preprint arXiv:2505.19938},
  year   = {2025}
}

备注

Accepted by IEEE TCSVT