HERMES++:迈向统一的三维场景理解与生成驾驶世界模型
计算机视觉与模式识别
2026-05-01 v1
摘要
驾驶世界模型通过模拟环境动力学,成为自动驾驶的关键技术。然而,现有方法主要侧重于未来场景生成,往往忽略了全面的三维场景理解。相反,尽管大语言模型(LLM)展现出令人印象深刻的推理能力,但它们缺乏预测未来几何演变的能力,这在语义解释和物理模拟之间造成了显著差距。为了弥合这一差距,我们提出了 HERMES++,这是一个统一的驾驶世界模型,将三维场景理解和未来几何预测集成在一个单一框架内。我们的方法通过协同设计来满足这些任务的不同需求。首先,BEV 表示将多视图空间信息整合到与 LLM 兼容的结构中。其次,我们引入了 LLM 增强的世界查询,以促进来自理解分支的知识迁移。第三,设计了一个当前到未来的链接来弥合时间差距,使几何演变以语义上下文为条件。最后,为了确保结构完整性,我们采用了一种联合几何优化策略,该策略将显式几何约束与隐式潜在正则化相结合,使内部表示与几何感知先验对齐。在多个基准上的广泛评估验证了我们方法的有效性。HERMES++ 取得了强大的性能,在未来点云预测和三维场景理解任务中均优于专家方法。模型和代码将在 https://github.com/H-EmbodVis/HERMESV2 公开发布。
引用
@article{arxiv.2604.28196,
title = {HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation},
author = {Xin Zhou and Dingkang Liang and Xiwu Chen and Feiyang Tan and Dingyuan Zhang and Hengshuang Zhao and Xiang Bai},
journal= {arXiv preprint arXiv:2604.28196},
year = {2026}
}
备注
Extended version of ICCV 25 paper HERMES, Code: https://github.com/H-EmbodVis/HERMESV2, Project page: https://h-embodvis.github.io/HERMESV2/