面向混合具身任务中长程演化的世界-自我建模
计算机视觉与模式识别
2026-05-20 v1 人工智能
机器人学
摘要
世界模型在具身智能中得到了广泛探索,但它们通常在一个单一流中预测世界和自我的不同演化,其中世界捕捉持久的、与指令无关的场景规律,而自我捕捉以机器人为中心的、以指令为条件的动态。这种世界-自我的纠缠导致在长程具身场景中性能下降,尤其是在具有交错导航和操作行为的混合任务中。在本文中,我们引入了世界-自我建模,这是一个新的概念范式,它将未来演化分解为世界和自我两个组成部分。我们从三个视角定义了世界-自我的边界,即基于运动、语义和意图的视角,并分析了三种解耦策略:后解耦、预解耦和全解耦。此外,我们将此范式实例化为世界-自我模型 (WEM),这是一个统一的具身世界模型,它将一个隐式的分离式世界-自我规划器与一个级联-并行混合专家 (CP-MoE) 扩散生成器耦合在一起。为了实现严格的评估,我们进一步构建了 HTEWorld,这是第一个用于长程世界建模的基准,包含混合导航-操作任务,提供了 125K 个视频片段(超过 450 万帧),带有细粒度的动作标注和 300 条多轮评估轨迹(超过 2K 条指令)。大量实验表明,WEM 在 HTEWorld 上达到了最先进的性能,同时在现有的纯操作基准上保持了竞争力。
引用
@article{arxiv.2605.19957,
title = {World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks},
author = {Zuyao Lin and Jianhui Zhang and Peidong Jia and Xiaoguang Zhao and Shanghang Zhang and Xingyu Chen},
journal= {arXiv preprint arXiv:2605.19957},
year = {2026}
}