UniScene:面向统一占据导向的驾驶场景生成
计算机视觉与模式识别
2025-03-12 v2
摘要
生成高保真、可控且带注释的训练数据对自动驾驶至关重要。现有方法通常直接从粗糙的场景布局生成单一数据形式,既无法输出满足多样化下游任务需求的丰富数据形式,又难以建模布局到数据的直接分布。本文引入 UniScene,首个实现生成驾驶场景中三种关键数据形式(语义占据、视频和激光点云)的统一框架。UniScene 采用分层的生成过程,将复杂的场景生成任务分解为两个步骤:(a)从定制化的场景布局生成语义占据作为富含语义与几何信息的元场景表示;(b)基于占据,分别采用高斯基联合渲染和先验引导稀疏建模策略生成视频和激光点云数据。这种占据导向方法在尤其是复杂场景下可显著降低生成负担,同时为后续生成阶段提供详尽的中间表示。大量实验表明,UniScene 在占据、视频和激光点云生成方面均优于以往 SOTA 方法,且确实能提升下游驾驶任务的性能。项目页面:https://arlo0o.github.io/uniscene/
引用
@article{arxiv.2412.05435,
title = {UniScene: Unified Occupancy-centric Driving Scene Generation},
author = {Bohan Li and Jiazhe Guo and Hongsi Liu and Yingshuang Zou and Yikang Ding and Xiwu Chen and Hu Zhu and Feiyang Tan and Chi Zhang and Tiancai Wang and Shuchang Zhou and Li Zhang and Xiaojuan Qi and Hao Zhao and Mu Yang and Wenjun Zeng and Xin Jin},
journal= {arXiv preprint arXiv:2412.05435},
year = {2025}
}
备注
CVPR 2025