基于稀疏样本的时空解耦知识补偿器用于少样本动作识别
计算机视觉与模式识别
2026-02-23 v1
摘要
少样本动作识别(FSAR)是一项具有挑战性的任务,需要识别仅含少量标记视频的新动作类别。近期研究通常将语义粗糙的类别名称作为辅助上下文,以引导学习判别性视觉特征。然而,由动作名称提供的此类上下文对于捕捉新动作中各种时空概念的背景知识有限。本文提出了 DiST 框架,一种创新的分解-整合方法,利用来自大型语言模型的解耦时空知识进行学习,以构建表达多粒度原型。在分解阶段,我们将常规动作名称解耦为多样化的时空属性描述(动作相关知识)。这种常识知识从时空角度补充了语义上下文。在整合阶段,我们提出了时空知识补偿器(SKC/TKC),分别用于发现对象级和帧级原型。在 SKC 中,对象级原型在时空知识的指导下自适应地聚合重要 patch token。在 TKC 中,帧级原型利用时空属性辅助跨帧时序关系建模。这些学习得到的原型因此在捕捉细粒度时空细节和多样化时序模式方面提供了可解释性。实验结果表明,DiST 在五个标准 FSAR 数据集上实现了最先进的成绩。
引用
@article{arxiv.2602.18043,
title = {Spatio-temporal Decoupled Knowledge Compensator for Few-Shot Action Recognition},
author = {Hongyu Qu and Xiangbo Shu and Rui Yan and Hailiang Gao and Wenguan Wang and Jinhui Tang},
journal= {arXiv preprint arXiv:2602.18043},
year = {2026}
}
备注
Accepted to TPAMI 2026