TesserAct:学习4D具身世界模型
计算机视觉与模式识别
2025-04-30 v1 机器人学
摘要
本文提出了一种有效的方法,用于学习新的4D具身世界模型,这些模型预测具身智能体行为对3D场景动态演化的响应,提供空间和时间一致性。我们提出通过在RGB-DN(RGB、深度和Normal)视频上进行训练来学习4D世界模型。这不仅超越了传统2D模型,因其纳入了对形状、配置和时间变化的详细预测,还允许我们有效地学习准确的具身智能体的逆动态模型。具体而言,我们首先通过利用现成模型扩展现有的机器人操作视频数据集,添加深度和Normal信息。接着,我们在该标注数据集上微调视频生成模型,该模型联合预测每个帧的RGB-DN。随后,我们提出一种算法,直接将生成的RGB、深度和Normal视频转换为高质量的4D场景。我们的方法确保了4D场景预测在具身情境下的时空一致性,使 novel view synthesis(新视图合成)对于具身环境成为可能,并且促进的策略学习显著优于来自先前基于视频的世界模型所派生的策略。
引用
@article{arxiv.2504.20995,
title = {TesserAct: Learning 4D Embodied World Models},
author = {Haoyu Zhen and Qiao Sun and Hongxin Zhang and Junyan Li and Siyuan Zhou and Yilun Du and Chuang Gan},
journal= {arXiv preprint arXiv:2504.20995},
year = {2025}
}
备注
Project Page: https://tesseractworld.github.io/