中文

具备高保真度和多样化可控性的通用驾驶世界模型

计算机视觉与模式识别 2024-05-28 v1

摘要

世界模型可以预测不同动作的结果,这对于自动驾驶至关重要。然而,现有的驾驶世界模型仍存在泛化到未见环境、关键细节预测保真度以及动作可控性等局限。本文我们提出Vista,一种具备高保真度和多样化可控性的通用驾驶世界模型。在对现有方法进行系统诊断后,我们引入了若干关键要素以解决这些局限。为了在高分辨率下准确预测真实世界动力学,我们提出了两种新型损失函数以促进移动实例和结构信息的学习。我们还设计了一种有效的潜空间替换方法,用于在长期预测中注入历史帧作为先验。对于动作可控性,我们通过一种高效学习策略,将从高层意图(指令、目标点)到低层机动(轨迹、角度、速度)的多样化控制集合纳入其中。经过大规模训练后,Vista的能力可以无缝泛化到不同场景。大量实验表明,Vista在多个数据集上超越了最先进的通用视频生成器在70%以上的比较中表现更好,FID提升55%,FVD提升27%。此外,我们首次利用Vista自身的容量为实际动作评估建立一种可泛化的奖励,而无需访问ground truth动作。

关键词

引用

@article{arxiv.2405.17397,
  title  = {Occlusion Handling in 3D Human Pose Estimation with Perturbed Positional Encoding},
  author = {Niloofar Azizi and Mohsen Fayyaz and Horst Bischof},
  journal= {arXiv preprint arXiv:2405.17397},
  year   = {2024}
}