EnerVerse:为机器人操作构想具身未来空间
机器人学
2025-11-18 v3 计算机视觉与模式识别
机器学习
摘要
我们介绍了 EnerVerse,一个构建和解释具身空间的生成式机器人基础模型。EnerVerse 采用分块自回归视频扩散框架,根据指令预测未来具身空间,并通过稀疏上下文记忆增强长期推理能力。为了对三维机器人世界进行建模,我们采用多视角视频表示,提供丰富视角以解决运动模糊和 3D 定位等挑战。此外,EnerVerse-D 是一个结合生成式建模与 4D Gaussian Splatting 的数据引擎流水线,形成自强化数据循环以缩小 sim-to-real 差距。借助这些创新,EnerVerse 通过策略头(EnerVerse-A)将 4D 世界表示转化为物理动作,在仿真和真实世界任务中均实现了 SOTA 性能。为了提高效率,EnerVerse-A 复用第一步去噪的特征并预测动作块,在单张 RTX 4090 上实现每 8 步动作块约 280 ms 的速度。更多视频演示和数据集样本可在我们的项目页面中找到。
引用
@article{arxiv.2501.01895,
title = {EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation},
author = {Siyuan Huang and Liliang Chen and Pengfei Zhou and Shengcong Chen and Zhengkai Jiang and Yue Hu and Yue Liao and Peng Gao and Hongsheng Li and Maoqing Yao and Guanghui Ren},
journal= {arXiv preprint arXiv:2501.01895},
year = {2025}
}
备注
Accepted by NeurIPS 2025. Website: https://sites.google.com/view/enerverse