中文

DiST-4D:基于度量深度的解耦时空扩散用于4D驾驶场景生成

计算机视觉与模式识别 2025-03-20 v1

摘要

当前的生成模型难以合成同时支持时间外推和空间新视角合成(NVS)且无需逐场景优化的动态4D驾驶场景。一个关键挑战在于找到一种高效且可泛化的几何表示,无缝连接时间和空间合成。为解决这一问题,我们提出了DiST-4D——首个用于4D驾驶场景生成的解耦时空扩散框架,它以度量深度作为核心几何表示。DiST-4D将问题分解为两个扩散过程:DiST-T从过去观测中直接预测未来度量深度和多视角RGB序列,DiST-S通过仅在现有视角上训练并强制循环一致性来实现空间NVS。这种循环一致性机制引入了前向-后向渲染约束,缩小了已观测视角与未观测视角之间的泛化差距。度量深度对于准确的可靠预测和精确的空间NVS都至关重要,因为它提供了一种视角一致的几何表示,能很好地泛化到未见视角。实验表明,DiST-4D在时间预测和NVS任务上均达到了最先进的性能,同时在规划相关评估中也提供了具有竞争力的性能。

关键词

引用

@article{arxiv.2503.15208,
  title  = {DiST-4D: Disentangled Spatiotemporal Diffusion with Metric Depth for 4D Driving Scene Generation},
  author = {Jiazhe Guo and Yikang Ding and Xiwu Chen and Shuo Chen and Bohan Li and Yingshuang Zou and Xiaoyang Lyu and Feiyang Tan and Xiaojuan Qi and Zhiheng Li and Hao Zhao},
  journal= {arXiv preprint arXiv:2503.15208},
  year   = {2025}
}