EgoSim: 闭环以太能动世界模拟器用于具身交互生成
计算机视觉与模式识别
2026-04-02 v1 人工智能
摘要
我们提出 EgoSim,一个闭环的以太能动世界模拟器,能够生成空间一致的交互视频并持续更新 underlying 3D 场景状态,以实现连续模拟。现有的以太能动模拟器要么缺乏明确的 3D grounding,导致在视点变化时出现结构漂移;要么将场景视为静态,无法在多阶段交互中更新世界状态。EgoSim 通过将 3D 场景建模为可更新的世界状态来解决上述两个局限性。我们通过几何-动作感知的观察模拟模型生成具身交互,并通过交互感知状态更新模块实现空间一致性。为克服获取密集对齐场景-交互训练对的瓶颈,我们设计了一个可扩展的管道,从野外大规模单目以太能动视频中提取静态点云、相机轨迹和具身动作。我们进一步引入 EgoCap,一个可低成本使用未标定智能手机收集真实世界数据的捕获系统。广泛的实验表明,EgoSim 在视觉质量、空间一致性和对复杂场景及野外灵巧交互的泛化能力方面显著优于现有方法,同时支持跨具身态的机器人操控迁移。代码和数据集将很快开源。项目页面位于 egosimulator.github.io。
引用
@article{arxiv.2604.01001,
title = {EgoSim: Egocentric World Simulator for Embodied Interaction Generation},
author = {Jinkun Hao and Mingda Jia and Ruiyan Wang and Xihui Liu and Ran Yi and Lizhuang Ma and Jiangmiao Pang and Xudong Xu},
journal= {arXiv preprint arXiv:2604.01001},
year = {2026}
}
备注
Project Page: egosimulator.github.io