用于动作识别的泰勒视频
计算机视觉与模式识别
2024-05-13 v4 机器学习
摘要
有效地从视频中提取运动是动作识别中一个关键且长期存在的问题。这个问题极具挑战性,因为运动(i)没有显式形式,(ii)具有位移、速度和加速度等多种概念,以及(iii)通常包含由不稳定像素引起的噪声。为应对这些挑战,我们提出了泰勒视频(Taylor video),这是一种新的视频格式,其每一帧(称为泰勒帧)都突出了主导运动(例如挥手)。泰勒视频以泰勒级数命名,后者利用重要项在给定点近似函数。在视频场景中,我们定义了一个隐式运动提取函数,旨在从视频时间块中提取运动。在该块中,利用帧、差分帧和高阶差分帧,我们在起始帧处对该函数执行泰勒展开。我们表明,泰勒级数中高阶项的求和给出了主导运动模式,同时去除了静态物体、微小且不稳定的运动。实验表明,泰勒视频是流行架构(包括 2D CNN、3D CNN 和 Transformer)的有效输入。单独使用时,泰勒视频产生的动作识别准确率与 RGB 视频和光流相比具有竞争力。当与 RGB 或光流视频融合时,可进一步提高准确率。此外,我们将泰勒视频计算应用于人体骨骼序列,生成了泰勒骨骼序列,其在基于骨骼的动作识别中优于原始骨骼的使用。
引用
@article{arxiv.2402.03019,
title = {Taylor Videos for Action Recognition},
author = {Lei Wang and Xiuyuan Yuan and Tom Gedeon and Liang Zheng},
journal= {arXiv preprint arXiv:2402.03019},
year = {2024}
}
备注
Published at the International Conference on Machine Learning (ICML 2024)