你的驾驶世界模型是否是全能选手?
计算机视觉与模式识别
2026-05-12 v1 机器人学
摘要
当今的驾驶世界模型能够生成惊人逼真的车载摄像视频,但却没有哪个模型在所有情形下都表现出色。有的模型生成逼真的纹理但违反基本物理规律;有的模型保持几何一致性但在闭环规划下失效。这种断层暴露了关键性缺口:该领域评估生成的世界外观多好,但很少评估它们是否行为上真实可靠。我们提出 WorldLens,一个统一基准,衡量世界模型在从像素质量、4D 几何到闭环驾驶和人类感知对齐的完整谱系上的忠实度,通过五个互补维度和 24 个标准化维度实现。我们评估了六个具代表性的模型,发现没有任何现有方法在所有维度上均能统治:纹理丰富的模型违反几何,几何感知的模型缺乏行为忠实度,即便是最强的表现者在人类真实感评级中也仅得 2-3 分(满分 10 分)。为将算法指标与人类感知联系起来,我们进一步贡献 WorldLens-26K,一个包含 26,808 条人类标注偏好数据的集合,包含数值评分与文本理由;以及 WorldLens-Agent,一个从这些判断中蒸馏得到的视觉-语言评估器,支持可扩展且可解释的自动评估。基准、数据集和评估器共同构成了一个统一生态系统,用于评估生成的世界,不仅凭视觉吸引力,而是以物理与行为忠实度为核心。
引用
@article{arxiv.2605.10858,
title = {Is Your Driving World Model an All-Around Player?},
author = {Lingdong Kong and Ao Liang and Tianyi Yan and Hongsi Liu and Wesley Yang and Ziqi Huang and Xian Sun and Wei Yin and Jialong Zuo and Yixuan Hu and Dekai Zhu and Dongyue Lu and Youquan Liu and Guangfeng Jiang and Linfeng Li and Xiangtai Li and Long Zhuo and Lai Xing Ng and Benoit R. Cottereau and Changxin Gao and Liang Pan and Wei Tsang Ooi and Ziwei Liu},
journal= {arXiv preprint arXiv:2605.10858},
year = {2026}
}
备注
CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens