MVISTA-4D:具有测试时动作推理的视图一致4D世界模型用于机器人操作
计算机视觉与模式识别
2026-05-27 v2
摘要
基于世界模型的“想象然后行动”成为机器人操作的一种有前景的范式,然而现有方法通常支持纯基于图像的预测或对部分3D几何的推理,限制了它们预测完整4D场景动态的能力。本文提出了一种新颖的具身4D世界模型,能够实现几何一致、任意视图的RGBD生成:仅以单视图RGBD观测作为输入,模型想象剩余视角,然后可以反投影并融合以在时间上组装更完整的3D结构。为了高效学习多视图、跨模态生成,我们显式设计了跨视图和跨模态特征融合,共同促进RGB和深度之间的一致性,并强制跨视图的几何对齐。除了预测之外,将生成的未来转换为动作通常由逆动力学处理,这是不适定的,因为多个动作可以解释相同的转换。我们通过一种测试时动作优化策略来解决这个问题,该策略通过生成模型反向传播以推断与预测未来最佳匹配的轨迹级潜在变量,以及一个残差逆动力学模型,将该轨迹先验转换为精确的可执行动作。在三个数据集上的实验展示了在4D场景生成和下游操作上的强大性能,消融研究为关键设计选择提供了实际见解。
引用
@article{arxiv.2602.09878,
title = {MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation},
author = {Jiaxu Wang and Yicheng Jiang and Tianlun He and Jingkai Sun and Qiang Zhang and Junhao He and Jiahang Cao and Zesen Gan and Mingyuan Sun and Qiming Shao and Xiangyu Yue},
journal= {arXiv preprint arXiv:2602.09878},
year = {2026}
}