中文

超越标签语义:面向少样本动作识别的语言引导动作解剖

计算机视觉与模式识别 2025-08-26 v2

摘要

少样本动作识别(FSAR)旨在对视频中的人类动作进行分类,且每个类别仅有少量标注样本。训练数据的稀缺性推动了近期将额外模态(特别是文本)纳入其中的努力。然而,人体姿态的细微变化、运动动力学以及在不同阶段发生的物体交互,是动作的关键固有知识,仅靠动作标签无法充分利用。在本工作中,我们提出了语言引导动作解剖(LGA),这是一个新颖的框架,它通过利用大语言模型(LLM)来剖析隐藏在动作标签之下的本质表征特征,从而超越了标签语义。在 LLM 中编码的先验知识的引导下,LGA 在少样本场景中有效地捕获了丰富的时空线索。具体而言,对于文本,我们提示现成的 LLM 将标签解剖为原子动作描述序列,重点关注动作的三个核心要素(主体、运动、客体)。对于视频,视觉解剖模块将动作分割为原子视频阶段,以捕获动作的序列结构。然后,细粒度融合策略在原子层面整合文本和视觉特征,从而产生更具泛化能力的原型。最后,我们引入了多模态匹配机制,包括视频-视频和视频-文本匹配,以确保鲁棒的少样本分类。实验结果表明,LGA 在多个 FSAR 基准上取得了 SOTA 性能。

关键词

引用

@article{arxiv.2507.16287,
  title  = {Beyond Label Semantics: Language-Guided Action Anatomy for Few-shot Action Recognition},
  author = {Zefeng Qian and Xincheng Yao and Yifei Huang and Chongyang Zhang and Jiangyong Ying and Hong Sun},
  journal= {arXiv preprint arXiv:2507.16287},
  year   = {2025}
}

备注

Accepted by ICCV2025