Ego2World:将以自我为中心的烹饪视频编译为可执行世界用于信念状态规划
人工智能
2026-05-14 v1 计算机视觉与模式识别
摘要
居家环境中的具身智能体必须在部分观察下进行规划:它们需要记忆物体、跟踪状态变化,并在动作失败时恢复。现有基准仅部分测试了这一能力。自我中心视频数据集捕捉了逼真的人类活动,但保持被动;而交互式模拟器支持执行,但依赖合成场景和手工制作的动态,引入仿真-现实鸿沟,常假设完全可观测状态。我们引入 Ego2World,将自我中心烹饪视频转化为受图转换规则管辖的可执行符号世界。基于 HD-EPIC,Ego2World 从视频注释中推导可重用的转换规则,并在隐藏符号世界图中执行。评估期间,模拟器维护隐藏世界图,而智能体仅通过局部观察和执行反馈,在自己的部分信念图上进行规划。这种分离迫使智能体在不观测真实世界状态的情况下更新记忆并重新规划。实验表明,动作重叠得分会高估物理状态成功率,持久的信念记忆在完成任务的同时减少了重复的视觉探索——这表明信念维护应是具身智能体评估的首要目标。
引用
@article{arxiv.2605.13335,
title = {Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning},
author = {Qinchuan Cheng and Zhantao Gong and Pengzhan Sun and Angela Yao and Xulei Yang and Shijie Li},
journal= {arXiv preprint arXiv:2605.13335},
year = {2026}
}
备注
Project page: https://sj-li.com/PROJ/Ego2World/