中文

基于提示引导的语义原型调制:few-shot 动作识别中区分视觉相似动作的方法

计算机视觉与模式识别 2025-12-23 v1

摘要

Few-shot 动作识别旨在使模型能够从有限的标记样本中快速学习新动作类别,解决现实应用中数据稀缺的挑战。当前研究主要针对三个核心问题:(1)时间建模,模型容易受到无关静态背景信息的干扰,难以捕捉动态动作特征的本质;(2)视觉相似性,难以区分具有细微视觉差异的类别;(3)视觉-文本支持原型与视觉查询之间存在模态差距,这使其在共享嵌入空间内的对齐变得复杂。为解决这些挑战,本文提出了 CLIP-SPM 框架,包括三个组件:(1)层次化协同运动细化(HSMR)模块,通过减少静态背景干扰来对齐深层和浅层运动特征,提高时间建模效果;(2)语义原型调制(SPM)策略,生成与查询相关的文本提示以弥合模态差距,并将其与视觉特征集成,增强相似动作之间的判别性;(3)原型锚双调制(PADM)方法,细化支持原型并将查询特征与全局语义锚对齐,以提高支持样本和查询样本之间的一致性。全面地在标准基准测试上进行实验,包括 Kinetics、SSv2-Full、SSv2-Small、UCF101 和 HMDB51,证明了我们的 CLIP-SPM 在 1-shot、3-shot 和 5-shot 设置下均取得竞争性能。 extensive ablation 研究和可视化分析进一步验证了每个组件的有效性及其对解决核心挑战的贡献。源代码和模型已在 GitHub 上公开。

关键词

引用

@article{arxiv.2512.19036,
  title  = {Distinguishing Visually Similar Actions: Prompt-Guided Semantic Prototype Modulation for Few-Shot Action Recognition},
  author = {Xiaoyang Li and Mingming Lu and Ruiqi Wang and Hao Li and Zewei Le},
  journal= {arXiv preprint arXiv:2512.19036},
  year   = {2025}
}

备注

19 pages, 7 figures. Preprint under review for journal submission