用于动作识别的深层集合条件潜表示
计算机视觉与模式识别
2022-12-22 v1
摘要
近年来,多标签、多类别视频动作识别获得了显著关注。尽管对时间相连的原子动作进行推理对智能物种而言稀松平常,标准人工神经网络(ANN)在分类它们时仍显吃力。在真实世界中,原子动作常时间相连形成更复杂的复合动作。挑战在于识别持续时间各异的复合动作,同时背景中还存在其他不同的复合或原子动作。借鉴关系网络的成功,我们提出学习对物体与动作语义概念进行推理的方法。我们通过实验展示了 ANN 如何从预训练、关系归纳偏置与无序基于集合的潜表示中获益。本文提出深层集合条件 I3D (SCI3D),一种采用状态潜表示与视觉表示来对事件与动作推理的双流关系网络。它们学会对时间相连动作进行推理,以识别视频中的所有动作。所提方法在 CATER 数据集上相较 I3D-NL 基线,在原子动作识别上提升约 1.49% mAP,在复合动作识别上提升 17.57% mAP。
引用
@article{arxiv.2212.11030,
title = {Deep set conditioned latent representations for action recognition},
author = {Akash Singh and Tom De Schepper and Kevin Mets and Peter Hellinckx and Jose Oramas and Steven Latre},
journal= {arXiv preprint arXiv:2212.11030},
year = {2022}
}
备注
Conference VISAPP 2022, 11 pages,5 figures, 2 Tables, 6 plots