中文

面向零样本动作识别的新型语义提示

计算机视觉与模式识别 2026-03-10 v1

摘要

零样本动作识别依赖于将视觉语言模型的知识传递给未见动作的语义描述。虽然近期方法侧重于时序建模或架构调整以处理视频数据,但我们认为语义提示本身提供了强大且被充分未探索的信号,用于零样本动作理解。我们引入SP-CLIP,一个轻量级框架,通过结构化语义提示在多个抽象层级(如意图、运动和物体交互)描述动作,增强冻结的视觉语言模型。无需修改视觉编码器或学习额外参数,SP-CLIP通过提示聚合和一致性评分将视频表征与丰富的文本语义对齐。跨标准基准的实验表明,语义提示显著提升了零样本动作识别,尤其对于细粒度和组合动作,而保持了预训练模型的效率和泛化能力。

关键词

引用

@article{arxiv.2603.08289,
  title  = {Novel Semantic Prompting for Zero-Shot Action Recognition},
  author = {Salman Iqbal and Waheed Rehman},
  journal= {arXiv preprint arXiv:2603.08289},
  year   = {2026}
}