中文

基于骨架侧置上下文的提示学习用于零样本骨架动作识别

计算机视觉与模式识别 2026-04-01 v1

摘要

零样本骨架动作识别旨在通过语义描述将知识从已见类别迁移到未见类别。大多数现有方法通常在共享的潜在空间中将骨架特征与文本嵌入对齐。然而,缺乏上下文线索(例如动作中涉及的物体),会在骨架和语义表示之间引入固有的差距,使其难以区分视觉上相似的动作。为此,我们提出SkeletonContext,一种基于提示的框架,通过语言驱动的上下文语义丰富骨架运动表示。具体而言,我们引入Cross-Modal Context Prompt模块,该模块利用预训练的语言模型在由LLM推导的指导下重建被掩码的上下文提示。这种设计有效地将语言上下文传递给骨架编码器,以实现实例级语义对齐并提高跨模态对齐。在此基础上,我们包含一个Key-Part Decoupling模块,用于解耦与运动相关的关节特征,确保即使在缺乏明确物体交互的情况下也能实现稳健的动作理解。广泛的实验表明,SkeletonContext在常规和广义零样本设置下均实现了最先进的性能,验证了其在推理上下文和区分细粒度、视觉上相似动作方面的有效性。

关键词

引用

@article{arxiv.2603.29692,
  title  = {SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition},
  author = {Ning Wang and Tieyue Wu and Naeha Sharif and Farid Boussaid and Guangming Zhu and Lin Mei and Mohammed Bennamoun and zhang liang},
  journal= {arXiv preprint arXiv:2603.29692},
  year   = {2026}
}

备注

Accepted by CVPR 2026