中文

基于先验知识与状态转移的可解释视频动作推理

计算机视觉与模式识别 2019-08-29 v1

摘要

视频中的人体动作分析与理解是一项重要且具有挑战性的任务。尽管近年来已取得实质性进展,现有方法的可解释性仍然有限。本文提出一种新颖的动作推理框架,利用先验知识来解释视频状态变化的语义级观测。我们的方法结合了经典推理与现代深度学习方法的优势。具体而言,先验知识被定义为目标视频领域的信息,包括该领域中一组对象、属性与关系,以及由时间与属性和关系变化(即状态转移)所定义的相关动作。给定一段视频序列,我们首先在每一帧上生成场景图以表示关注的对象、属性与关系。随后通过跨帧跟踪对象将这些场景图连接成时空图(亦称视频图),用于表示语义级视频状态。最后,通过依次检查视频图中的每个状态转移,我们的方法能够借助先验知识检测并解释这些动作是如何执行的,犹如人类的逻辑思维方式。与以往工作相比,我们方法的动作推理结果既可由逻辑规则解释,也可由视频内容变化的语义级观测解释。此外,所提方法可用于检测多个并发动作并提供详细信息,例如谁(特定对象)、何时(时间)、何处(对象位置)以及怎样(何种变化)。在重新标注的数据集 CAD-120 上的实验表明了方法的有效性。

关键词

引用

@article{arxiv.1908.10700,
  title  = {Explainable Video Action Reasoning via Prior Knowledge and State Transitions},
  author = {Tao Zhuo and Zhiyong Cheng and Peng Zhang and Yongkang Wong and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:1908.10700},
  year   = {2019}
}