动作基因组:作为时空场景图组合的动作
计算机视觉与模式识别
2019-12-17 v1
摘要
动作识别通常将动作和活动视为视频中发生的整体事件。然而,认知科学与神经科学有证据表明,人们会主动将活动编码为一致的层次化部分结构。但在计算机视觉中,对编码事件部分层级表示的探索甚少。受“事件的原型单元是动作-物体交互”这一证据启发,我们提出动作基因组(Action Genome),一种将动作分解为时空场景图的表示。动作基因组捕捉动作发生时物体及其两两关系之间的变化。它包含10K视频,标注了0.4M个物体和1.7M个视觉关系。借助动作基因组,我们通过将场景图作为时空特征库融入现有动作识别模型,在Charades数据集上取得了更好性能。接下来,通过分解并学习导致某一动作的视觉关系的时间变化,我们展示了层次化事件分解的效用,实现了少样本动作识别,仅用10个样本即达到42.7% mAP。最后,我们在时空场景图预测这一新任务上对所现有场景图模型进行了基准测试。
引用
@article{arxiv.1912.06992,
title = {Action Genome: Actions as Composition of Spatio-temporal Scene Graphs},
author = {Jingwei Ji and Ranjay Krishna and Li Fei-Fei and Juan Carlos Niebles},
journal= {arXiv preprint arXiv:1912.06992},
year = {2019}
}