中文

面向少样本动作识别的任务自适应时空视频采样器

计算机视觉与模式识别 2022-12-23 v3 人工智能

摘要

少样本动作识别面临的主要挑战是训练视频数据不足。为此,该领域现有方法主要致力于特征层算法设计,鲜少关注输入视频数据处理。此外,现有帧采样策略可能在时间与空间维度遗漏关键动作信息,进一步影响视频利用效率。本文提出一种用于少样本动作识别的新型视频帧采样器以应对该问题,通过时间选择器(TS)与空间放大器(SA)实现任务特定的时空帧采样。具体而言,采样器首先以较小计算代价扫描整段视频以获得视频帧的全局感知。TS发挥作用,筛选贡献最显著的前T帧及其后续帧。SA在显著性图引导下放大关键区域,以强化每帧的判别信息。我们进一步采用任务自适应学习,根据当前片段任务动态调整采样策略。TS与SA均为可微分实现,支持端到端优化,便于所提采样器与多数少样本动作识别方法无缝集成。大量实验表明,在包括长视频在内的多种基准上性能显著提升。代码见https://github.com/R00Kie-Liu/Sampler。

关键词

引用

@article{arxiv.2207.09759,
  title  = {Task-adaptive Spatial-Temporal Video Sampler for Few-shot Action Recognition},
  author = {Huabin Liu and Weixian Lv and John See and Weiyao Lin},
  journal= {arXiv preprint arXiv:2207.09759},
  year   = {2022}
}

备注

Accepted by ACM MM 2022