中文

Mimetics:面向无上下文人体动作理解

计算机视觉与模式识别 2021-02-03 v3

摘要

近期视频动作识别方法在现有基准上取得了卓越性能。然而,它们倾向于利用场景或物体等上下文,而非聚焦于理解人体动作本身。例如,网球场会导致预测为打网球,而不论视频中实际执行的动作。相比之下,人类对人体动作有更完整的理解,可在无上下文情况下识别动作。无上下文动作的最佳范例是默剧,人们通常能在缺失相关物体和场景时识别之。本文提出在此类上下文缺失情况下对动作识别方法进行基准测试,并引入一个新数据集 Mimetics,由来自 Kinetics 基准中 50 个类别子集的默剧动作组成。我们的实验表明:(a)最先进的 3D 卷积神经网络在此类视频上结果令人失望,凸显了对人体动作真实理解的缺乏;(b)通过人体姿态利用身体语言的模型较少受上下文偏置影响。特别地,我们展示在动作识别问题上,将浅层神经网络配合单时间卷积作用于迁移得到的身体姿态特征,相较于 3D 动作识别方法表现得出奇地好。

关键词

引用

@article{arxiv.1912.07249,
  title  = {Mimetics: Towards Understanding Human Actions Out of Context},
  author = {Philippe Weinzaepfel and Grégory Rogez},
  journal= {arXiv preprint arXiv:1912.07249},
  year   = {2021}
}