中文

基于运动引导的语义对齐与负提示的零样本视频动作识别

计算机视觉与模式识别 2026-04-21 v1

摘要

零样本动作识别因见到的类别与未见到的类别之间的语义鸿沟而具有挑战性。我们提出了一种新框架,通过解耦嵌入和语义引导的交互来增强 CLIP。运动分离模块 (MSM) 将运动敏感特征与全局静态特征分离,而运动聚合块 (MAB) 采用门控跨注意力机制来细化运动表征,而无需重新耦合冗余信息。为促进对未见类别的泛化,我们通过对齐投影后的嵌入与正文本提示来实现语义对齐,同时利用负提示显式建模“非类别”语义。实验在标准基准数据集上表明,我们的方法在大多数基于 CLIP 的先前方法之上 consistently 获得了更好的性能,实现了对粗粒度和细粒度数据集的稳健零样本动作识别。

关键词

引用

@article{arxiv.2604.17062,
  title  = {Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition},
  author = {Yiming Wang and Frederick W. B. Li and Jingyun Wang},
  journal= {arXiv preprint arXiv:2604.17062},
  year   = {2026}
}

备注

5 pages, 3 figures, accepted by ICASSP 2026