面向动作识别的张量表示
计算机视觉与模式识别
2021-08-31 v3
摘要
视频序列中的人体动作以空间特征与其时间动态之间的复杂相互作用为特征。本文提出新颖的张量表示,用于紧凑地捕捉视觉特征之间此类用于动作识别任务的高阶关系。我们提出两种基于张量的特征表示,即(i)序列兼容性核(SCK)与(ii)动态兼容性核(DCK)。SCK建立在特征间的时空相关性之上,而DCK显式建模序列的动作动态。我们还探讨了SCK的推广,称为SCK(+),其在子序列上运作以捕捉相关性的局部-全局相互作用,并可融合多模态输入,例如从视频上训练的深度学习方法获得的骨架3D身体关节与逐帧分类器分数。我们引入这些核的线性化,从而得到紧凑且快速的描述子。我们在(i)3D骨架动作序列、(ii)细粒度视频序列与(iii)标准非细粒度视频上进行了实验。由于我们的最终表示为捕捉特征高阶关系的张量,它们关联到共现以实现鲁棒的细粒度识别。我们使用高阶张量与所谓的特征值幂归一化(EPN),其长期以来被推测可对高阶共现进行谱检测,从而检测特征间的细粒度关系,而非仅仅对动作序列中的特征计数。我们证明,由Z*维特征构建的r阶张量,结合EPN,确实能检测是否至少有一个高阶共现被“投影”到由其表示的dim. r的binom(Z*,r)个子空间之一中,从而形成具有binom(Z*,r)个此类“检测器”的张量幂归一化度量。
引用
@article{arxiv.2012.14371,
title = {Tensor Representations for Action Recognition},
author = {Piotr Koniusz and Lei Wang and Anoop Cherian},
journal= {arXiv preprint arXiv:2012.14371},
year = {2021}
}
备注
Published with TPAMI, 2020. arXiv admin note: text overlap with arXiv:1604.00239