基于层次化关系增强表示的少样本动作识别
计算机视觉与模式识别
2026-05-28 v4
摘要
少样本动作识别(FSAR)旨在以少量样本识别新动作类别。现有方法通常通过设计帧级表示的时序建模策略或粗糙视频级别的互动来学习每个视频的帧级表示。然而,这些方法将每个剧集任务视为孤立处理,忽略了视频之间细粒度时序关系建模,从而无法捕捉跨视频的共享细粒度时序模式,也无法复用来自历史任务的时序知识。鉴于此,我们提出了HR2G-shot框架,即面向FSAR的层次化关系增强表示通用框架,统一三种关系建模(帧间、视频间和任务间)从整体视角学习任务特定的时序模式。超越进行帧间时序互动,我们进一步设计了两个组件:i) 视频间语义相关性(ISC)以细粒度方式进行跨视频帧级互动,从而捕捉任务特定的查询特征,增强类内一致性和类间可分性;ii) 任务间知识传递(IKT)从存储来自历史剧集任务中多样化时序模式的数据库中检索并聚合相关时序知识。在五个基准测试上的大量实验表明,HR2G-shot超过当前领先的FSAR方法。
引用
@article{arxiv.2504.10079,
title = {Hierarchical Relation-augmented Representation Generalization for Few-shot Action Recognition},
author = {Hongyu Qu and Ling Xing and Jiachao Zhang and Rui Yan and Yazhou Yao and Xiangbo Shu},
journal= {arXiv preprint arXiv:2504.10079},
year = {2026}
}