基于上下文建模与基于模型的策略学习的教学视频中的步骤规划
计算机视觉与模式识别
2021-10-12 v2 人工智能
摘要
通过观察人类行为学习新技能是人工智能的一项基本能力。在这项工作中,我们利用教学视频来研究人类的决策过程,重点学习一个在真实生活视频中规划目标导向动作的模型。与传统的动作识别不同,目标导向动作基于对动作结果的预期,需要关于动作潜在后果的因果知识。因此,将环境结构与目标相整合对于解决该任务至关重要。先前的工作学习单一世界模型将无法区分不同任务,导致潜在空间模糊;通过它进行规划会逐步忽略期望结果,因为未来目标的全局信息随步骤推进迅速退化。我们通过步骤规划的新表述来解决这些局限,并提出新颖算法,通过贝叶斯推断和基于模型的模仿学习来对人类行为进行建模。在真实世界教学视频上的实验表明,我们的方法在达到指定目标方面可以达到最先进的性能。此外,学习到的上下文信息展现出用于潜在空间规划的有趣特征。
引用
@article{arxiv.2110.01770,
title = {Procedure Planning in Instructional Videos via Contextual Modeling and Model-based Policy Learning},
author = {Jing Bi and Jiebo Luo and Chenliang Xu},
journal= {arXiv preprint arXiv:2110.01770},
year = {2021}
}
备注
ICCV 2021 Oral