中文

面向高效LiDAR世界模型的潜在流匹配

计算机视觉与模式识别 2025-10-23 v2 机器人学

摘要

LiDAR-based世界模型比其图像基方法更具结构性和几何感知能力。然而,现有LiDAR世界模型训练范围狭窄;每个模型仅在其构建所专属领域中取得佳绩。我们能否开发出在多个领域之间表现出强大可迁移性的LiDAR世界模型?我们进行了首次系统性的领域迁移研究,涵盖三个挑战性场景:(i)户外到室内泛化,(ii)稀疏束到稠密束适应,(iii)非语义到语义迁移。在不同细调数据量下,我们的实验表明,单个预训练模型可实现最高11%绝对提升(83%相对提升),并在我们30/36个比较中超过从头训练。这种动态学习的可迁移性显著减少了对语义占据预测手动标注数据的依赖:我们的方法仅需先前方法所需的5%标注训练数据即可超越。我们也观察到当前LiDAR世界模型的效率低下,主要通过其对LiDAR数据 under-compression以及低效训练目标。为此,我们提出一种基于潜在条件流匹配(CFM)的框架,仅需一半训练数据即可实现最高的恢复精度,压缩比是先前方法的6倍。我们的模型在基于未来轨迹条件的语义占据预测中实现SOTA性能,计算效率提升23倍(FPS提升28倍);在语义占据预测中实现SOTA性能,计算效率提升2倍(FPS提升1.1倍)。

关键词

引用

@article{arxiv.2506.23434,
  title  = {Towards foundational LiDAR world models with efficient latent flow matching},
  author = {Tianran Liu and Shengwen Zhao and Nicholas Rhinehart},
  journal= {arXiv preprint arXiv:2506.23434},
  year   = {2025}
}

备注

Accepted to the Thirty-Ninth Conference on Neural Information Processing Systems (NeurIPS 2025), 25 pages, 13 figures