RenderWorld:具有自监督3D标签的世界模型
计算机视觉与模式识别
2025-02-14 v2 人工智能
摘要
纯视觉端到端自动驾驶不仅比激光雷达-视觉融合方案更具成本效益,也比传统方法更可靠。为了实现一个经济且鲁棒的纯视觉自动驾驶系统,我们提出了RenderWorld,一个纯视觉端到端自动驾驶框架。该框架利用基于自监督高斯的Img2Occ模块生成3D占用标签,然后通过AM-VAE对标签进行编码,并使用世界模型进行预测和规划。RenderWorld采用高斯泼溅(Gaussian Splatting)来表示3D场景并渲染2D图像,与基于NeRF的方法相比,显著提高了分割精度并降低了GPU内存消耗。通过应用AM-VAE分别编码空气和非空气部分,RenderWorld实现了更细粒度的场景元素表示,从而在基于自回归世界模型的4D占用预测和运动规划中均达到了最先进的性能。
引用
@article{arxiv.2409.11356,
title = {RenderWorld: World Model with Self-Supervised 3D Label},
author = {Ziyang Yan and Wenzhen Dong and Yihua Shao and Yuhang Lu and Liu Haiyang and Jingwen Liu and Haozhe Wang and Zhe Wang and Yan Wang and Fabio Remondino and Yuexin Ma},
journal= {arXiv preprint arXiv:2409.11356},
year = {2025}
}
备注
Accepted in 2025 IEEE International Conference on Robotics and Automation (ICRA)