中文

具身VideoAgent:来自自我中心视频和具身传感器的持久记忆实现动态场景理解

计算机视觉与模式识别 2025-01-10 v2

摘要

本文研究了从自我中心观察理解动态3D场景的问题,这是机器人和具身AI中的一个关键挑战。与之前将其作为长形式视频理解并仅利用自我中心视频的研究不同,我们提出了一种基于LLM的智能体Embodied VideoAgent,它从自我中心视频和具身传感器输入(例如深度和姿态感知)构建场景记忆。我们进一步引入了一种基于VLM的方法,当感知到对物体的动作或活动时自动更新记忆。Embodied VideoAgent在3D场景中的挑战性推理和规划任务上取得了显著优势,在Ego4D-VQ3D上提升了4.9%,在OpenEQA上提升了5.8%,在EnvQA上提升了11.7%。我们还展示了其在各种具身AI任务中的潜力,包括生成具身交互和机器人操作的感知。代码和演示将公开。

关键词

引用

@article{arxiv.2501.00358,
  title  = {Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding},
  author = {Yue Fan and Xiaojian Ma and Rongpeng Su and Jun Guo and Rujie Wu and Xi Chen and Qing Li},
  journal= {arXiv preprint arXiv:2501.00358},
  year   = {2025}
}

备注

project page: https://embodied-videoagent.github.io/