中文

基于运动引导注意力的视频到任务学习用于小样本动作识别

计算机视觉与模式识别 2024-11-19 v1

摘要

近年来,小样本动作识别通过时空关系建模取得了显著性能。尽管已提出多种空间和时间对齐模块,但它们主要解决视频级别的空间或时间错位问题,而任务级别上不同视频间的时空关系仍未被充分探索。近期研究利用类原型来学习任务特定特征,但忽略了任务级别上不同视频间的时空关系,尤其是在空间维度上,这些关系提供了丰富的信息。本文提出了一种新颖的双重运动引导注意力学习方法(称为 DMGAL)用于小样本动作识别,旨在学习从视频特定级别到任务特定级别的时空关系。为此,我们设计了一种精心设计的运动引导注意力(MGA)方法,以识别并关联从视频级别到任务级别的运动相关区域特征。具体而言,自运动引导注意力模块(S-MGA)通过识别和关联同一视频内不同帧之间的运动相关区域特征,实现视频级别的时空关系建模。交叉运动引导注意力模块(C-MGA)则识别并关联特定任务内不同视频帧之间的运动相关区域特征,以实现任务级别的时空关系。该方法使模型能够构建完全融合从视频特定级别到任务特定级别时空关系的类原型。我们通过采用完全微调和适配器微调两种范式验证了 DMGAL 方法的有效性。使用这些范式开发的模型分别称为 DMGAL-FT 和 DMGAL-Adapter。

关键词

引用

@article{arxiv.2411.11335,
  title  = {Video-to-Task Learning via Motion-Guided Attention for Few-Shot Action Recognition},
  author = {Hanyu Guo and Wanchuan Yu and Suzhou Que and Kaiwen Du and Yan Yan and Hanzi Wang},
  journal= {arXiv preprint arXiv:2411.11335},
  year   = {2024}
}