STAR:面向少样本动作识别的语义-时序自适应表示学习
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
少样本动作识别(FSAR)需要模型从仅少量标注样本中泛化到新的动作类别。尽管视觉语言模型取得了进展,现有方法仍存在语义-时序错位问题,即静态文本提示难以捕获稀疏出现于序列中的决定性视觉线索,以及对多尺度时序动态建模不足的问题——短期判别性线索和长程依赖要么被过度平滑,要么被碎片化。为此,本文提出了语义时序自适应表示学习(STAR),是一个统一的框架,包含语义对齐组件和时序感知组件,有效弥合语义与时序之间的差距,并将Mamba的序列建模能力引入FSAR。语义对齐模块引入了时间语义注意(TSA)机制,进行帧级交叉模态对齐,确保细粒度的语义-时序一致性。时序感知模块包含语义时序原型细化器(STPR),将语义引导的Mamba模块与多频率时序采样和双向状态空间细化相结合,生成具有增强判别保真度和时序一致性的语义对齐原型。此外,来自大语言模型(LLM)的时序相关类别描述提供了长程语义指导。在五个FSAR基准数据集上的大量实验表明,STAR consistently优于最先进的方法。例如,在1-shot设置下,STAR在SSv2-Full和SSv2-Small数据集上分别实现了最高8.1%和6.7%的提升,在HMDB51上实现了7.3%的提升,验证了其在有限监督下的有效性。代码已公开于https://github.com/HongliLiu1/STAR-main。
引用
@article{arxiv.2605.13202,
title = {STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition},
author = {Hongli Liu and Yu Wang and Shengjie Zhao},
journal= {arXiv preprint arXiv:2605.13202},
year = {2026}
}
备注
Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)