面向少样本动作识别的联合图像-实例时空注意力
计算机视觉与模式识别
2025-03-19 v1
摘要
少样本动作识别(FSAR)是计算机视觉中的一个关键挑战,涉及从有限示例集中识别动作。最近的研究方法主要 focus 于利用图像级特征构建时序依赖性并为每个动作类别生成原型。然而,这些方法大量利用包含背景噪声的图像级特征, insufficiently 关注真正的前景(与动作相关的实例),从而在少样本情境下削弱了识别能力。为解决此问题,我们提出一种 novel 的联合 Image-Instance 时空注意力方法(I2ST)用于少样本动作识别。I2ST 的核心思想是感知与动作相关的实例并通过时空注意力将其与图像特征集成。具体而言,I2ST 包含两个关键组件:与动作相关的实例感知与联合图像-实例时空注意力。给定基本表示从特征提取器获得,动作相关实例感知在文本引导的分割模型指导下引入以感知与动作相关的实例。随后,联合图像-实例时空注意力用于构建实例和图像之间的特征依赖。
引用
@article{arxiv.2503.14430,
title = {Joint Image-Instance Spatial-Temporal Attention for Few-shot Action Recognition},
author = {Zefeng Qian and Chongyang Zhang and Yifei Huang and Gang Wang and Jiangyong Ying},
journal= {arXiv preprint arXiv:2503.14430},
year = {2025}
}
备注
Accepted by Computer Vision and Image Understanding