中文

语义视频预测中的模块化动作概念接地

计算机视觉与模式识别 2022-04-27 v4 人工智能 机器学习

摘要

近期视频预测的工作主要集中于被动预测和低层动作条件预测,回避了智能体与物体之间交互的学习。我们引入了语义动作条件视频预测任务,其使用语义动作标签来描述这些交互,并可视为动作识别的逆问题。这一新任务的挑战主要在于如何有效地将语义动作信息告知模型。受混合专家思想启发,我们通过各种视觉概念学习器的结构化组合来体现每个抽象标签,并提出一种新颖的视频预测模型——模块化动作概念网络(MAC)。我们的方法在两个新设计的合成数据集 CLEVR-Building-Blocks 和 Sapien-Kitchen,以及一个称为 Tower-Creation 的真实世界数据集上进行了评估。大量实验表明,MAC 能够正确以给定指令为条件并生成相应的未来帧,而无需边界框。我们进一步展示,训练后的模型可以进行分布外泛化,快速适应新物体类别,并利用其学到的特征进行物体检测,显示出向更高层认知能力的发展。更多可视化见 http://www.pair.toronto.edu/mac/。

关键词

引用

@article{arxiv.2011.11201,
  title  = {Modular Action Concept Grounding in Semantic Video Prediction},
  author = {Wei Yu and Wenxin Chen and Songhenh Yin and Steve Easterbrook and Animesh Garg},
  journal= {arXiv preprint arXiv:2011.11201},
  year   = {2022}
}

备注

To appear in CVPR 2022