中文

视频动作检测:局限性与挑战分析

计算机视觉与模式识别 2022-04-19 v1

摘要

除了具备足够大的规模以喂养数据饥渴的机器(如 transformers)之外,哪些属性可以衡量一个数据集的质量?假设此类属性的定义确实存在,我们如何量化它们之间的相对存在程度?我们的工作试图为视频动作检测探索这些问题。该任务旨在对演员进行时空定位并赋予相关的动作类别。我们首先分析现有的视频动作检测数据集并讨论其局限性。接下来,我们提出一个新的数据集 Multi Actor Multi Action (MAMA),它克服了这些局限性,并且更适用于真实世界应用。此外,我们进行了一项偏向性研究,分析区分视频与静态图像的一个关键属性:时间方面。这揭示了这些数据集中的动作是否真正需要演员的运动信息,或者即便仅看单帧也能预测动作的发生。最后,我们调查了关于时间顺序重要性的广泛假设:时间顺序对于这些动作的检测是否重要?此类极端实验显示出偏见的存生,尽管建模谨慎,它们仍悄然渗入现有方法中。

关键词

引用

@article{arxiv.2204.07892,
  title  = {Video Action Detection: Analysing Limitations and Challenges},
  author = {Rajat Modi and Aayush Jung Rana and Akash Kumar and Praveen Tirupattur and Shruti Vyas and Yogesh Singh Rawat and Mubarak Shah},
  journal= {arXiv preprint arXiv:2204.07892},
  year   = {2022}
}

备注

CVPRW'22