中文

动态表观:一种用于动作识别并联合训练的视觉表征

计算机视觉与模式识别 2022-11-28 v2

摘要

视频的静态表观可能会阻碍深度神经网络在视频动作识别中学习运动相关特征的能力。本文引入一个新概念——动态表观(Dynamic Appearance, DA),它概括了视频中与运动相关的表观信息,同时滤除被认为与运动无关的静态信息。我们将从原始视频数据中蒸馏动态表观视为一种高效的视频理解手段。为此,我们提出像素级时间投影(Pixel-Wise Temporal Projection, PWTP),它将视频的静态表观投影到其原始向量空间内的一个子空间中,而动态表观则编码在描述一种特殊运动模式的投影残差中。此外,我们将 PWTP 模块与 CNN 或 Transformer 集成到一个端到端训练框架中,并利用多目标优化算法进行优化。我们在四个动作识别基准上提供了广泛的实验结果:Kinetics400、Something-Something V1、UCF101 和 HMDB51。

关键词

引用

@article{arxiv.2211.12748,
  title  = {Dynamic Appearance: A Video Representation for Action Recognition with Joint Training},
  author = {Guoxi Huang and Adrian G. Bors},
  journal= {arXiv preprint arXiv:2211.12748},
  year   = {2022}
}