中文

基于帧内与帧间信息最大化的小样本动作识别

计算机视觉与模式识别 2023-05-11 v1 人工智能 机器学习

摘要

当前的小样本动作识别涉及用于分类的两个主要信息来源:(1)帧内信息,由单个视频片段内的帧内容决定;(2)帧间信息,由视频之间的关系(例如特征相似度)度量。然而,现有方法未能充分利用这两种信息来源。在帧内信息方面,当前对输入视频的采样操作可能遗漏关键动作信息,降低了视频数据的利用效率。对于帧间信息,视频间的动作不对齐使得精确计算关系具有挑战性。此外,如何联合考虑帧间与帧内信息在小样本动作识别中仍未被充分探索。为此,我们提出了一种新颖的框架——视频信息最大化(VIM),用于小样本视频动作识别。VIM 配备了一个自适应时空视频采样器和一个时空动作对齐模型,分别用于最大化帧内和帧间信息。该视频采样器根据当前任务为每个输入视频自适应地选择重要帧并放大关键空间区域。这在数据层面保留并突出了视频片段中的信息部分,同时消除了干扰。该对齐模型在特征层面依次执行时间和空间动作对齐,从而更精确地度量帧间相似度。最后,通过引入基于互信息度量的额外损失项来促进这些目标。因此,VIM 致力于从有限的视频数据中最大化视频信息的区分性。在公开小样本动作识别数据集上的大量实验结果证明了我们框架的有效性和优势。

关键词

引用

@article{arxiv.2305.06114,
  title  = {Few-shot Action Recognition via Intra- and Inter-Video Information Maximization},
  author = {Huabin Liu and Weiyao Lin and Tieyuan Chen and Yuxi Li and Shuyuan Li and John See},
  journal= {arXiv preprint arXiv:2305.06114},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2207.09759