DynamicCity:来自动态场景的大规模 4D 占用生成
计算机视觉与模式识别
2025-12-04 v3 机器人学
摘要
城市场景生成近年来发展迅速。然而,现有方法主要关注生成静态和单帧场景,忽视了真实驾驶环境固有的动态特性。在这项工作中,我们引入了 DynamicCity,一种新颖的 4D 占用生成框架,能够生成大规模、高质量、带语义的动态 4D 场景。DynamicCity 主要由两个关键模型组成。1) 一个用于学习 HexPlane 作为紧凑 4D 表示的 VAE 模型。DynamicCity 没有使用简单的平均操作,而是采用一种新颖的投影模块,将 4D 特征有效压缩为六个 2D 特征图用于 HexPlane 构建,这显著提升了 HexPlane 的拟合质量(高达 12.56 mIoU 增益)。此外,我们利用扩展与压缩策略并行重建 3D 特征体,这比朴素地查询每个 3D 点提高了网络训练效率和重建精度(高达 7.05 mIoU 增益、2.06 倍训练加速和 70.84% 内存减少)。2) 一个基于 DiT 的扩散模型用于 HexPlane 生成。为了使 HexPlane 适用于 DiT 生成,提出了一种填充滚动操作,将 HexPlane 的所有六个特征平面重新组织为一个方形 2D 特征图。特别地,可以在扩散或采样过程中引入各种条件,支持多种 4D 生成应用,例如轨迹和命令驱动的生成、修复以及布局条件生成。在 CarlaSC 和 Waymo 数据集上的大量实验表明,DynamicCity 在多个指标上显著优于现有的最先进 4D 占用生成方法。代码和模型已发布以促进未来研究。
引用
@article{arxiv.2410.18084,
title = {DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes},
author = {Hengwei Bian and Lingdong Kong and Haozhe Xie and Liang Pan and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2410.18084},
year = {2025}
}
备注
ICLR 2025 Spotlight; 35 pages, 18 figures, 15 tables; Project Page at https://dynamic-city.github.io/