中文

Target-Bench:视频世界模型能否实现无地图的语义目标路径规划?

计算机视觉与模式识别 2026-04-16 v2 机器人学

摘要

虽然最近的视频世界模型能够生成高度逼真的视频,但其进行语义推理和规划能力尚不明确且缺乏量化评估。我们引入Target-Bench,这是首个能够全面评估视频世界模型语义推理、空间估计和规划能力的基准测试。Target-Bench提供450组机器人收集的场景,覆盖47个语义类别,采用基于SLAM的轨迹作为运动趋势参考。我们的基准测试通过度量尺度恢复机制重建运动,利用五个互补指标评估规划性能,这些指标聚焦于目标接近能力和方向一致性。我们的评估结果表明,最佳现成模型仅获得0.341的总体得分,揭示了当前视频世界模型在逼真视觉生成与语义推理之间存在显著鸿沟。此外,我们证明,对相对小规模的真实世界机器人数据集进行精调可显著提升任务级别的规划性能。

关键词

引用

@article{arxiv.2511.17792,
  title  = {Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?},
  author = {Dingrui Wang and Zhihao Liang and Hongyuan Ye and Zhexiao Sun and Zhaowei Lu and Yuchen Zhang and Yuyu Zhao and Yuan Gao and Marvin Seegert and Finn Schäfer and Haotong Qin and Wei Li and Luigi Palmieri and Felix Jahncke and Mattia Piccinini and Johannes Betz},
  journal= {arXiv preprint arXiv:2511.17792},
  year   = {2026}
}

备注

19 pages