中文

利用来自第一人称视频的活动-上下文先验塑造具身智能体行为

计算机视觉与模式识别 2021-10-18 v1 机器人学

摘要

复杂的物理任务需要一系列对象交互,每个交互都有其自身的前提条件——这对机器人智能体仅通过自身经验高效学习可能很困难。我们引入了一种方法,从人类佩戴相机捕获的野外第一人称视频中发现活动-上下文先验。对于给定的对象,活动-上下文先验表示活动成功所需的其他兼容对象集合(例如,刀和砧板与番茄放在一起有利于切割)。我们将基于视频的先验编码为一个辅助奖励函数,鼓励智能体在尝试交互之前将兼容的对象放在一起。通过这种方式,我们的模型将日常人类经验转化为具身智能体技能。我们使用记录人们在无脚本厨房活动的第一人称 EPIC-Kitchens 视频来展示我们的想法,以帮助虚拟家用机器人智能体在 AI2-iTHOR 中执行各种复杂任务,显著加速了智能体学习。项目页面:http://vision.cs.utexas.edu/projects/ego-rewards/

关键词

引用

@article{arxiv.2110.07692,
  title  = {Shaping embodied agent behavior with activity-context priors from egocentric video},
  author = {Tushar Nagarajan and Kristen Grauman},
  journal= {arXiv preprint arXiv:2110.07692},
  year   = {2021}
}