WoVoGen:面向可控多相机驾驶场景生成的世界体积感知扩散模型
计算机视觉与模式识别
2024-08-09 v4
摘要
生成多相机街景视频对于增强自动驾驶数据集至关重要,可满足对广泛且多样化数据的迫切需求。由于多样性方面的局限性和处理光照条件的挑战,传统的基于渲染的方法正日益被基于扩散的方法所取代。然而,基于扩散的方法面临的一个重大挑战是确保生成的传感器数据同时保持世界内一致性和传感器间连贯性。为了解决这些挑战,我们结合了一个额外的显式世界体积,并提出了世界体积感知的多相机驾驶场景生成器(WoVoGen)。该系统专门设计用于利用4D世界体积作为视频生成的基础元素。我们的模型在两个不同的阶段运行:(i) 基于车辆控制序列设想未来的4D时间世界体积,以及 (ii) 根据设想的4D时间世界体积和传感器互连性生成多相机。4D世界体积的引入使WoVoGen不仅能够响应车辆控制输入生成高质量的街景,还能促进场景编辑任务。
引用
@article{arxiv.2312.02934,
title = {WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation},
author = {Jiachen Lu and Ze Huang and Zeyu Yang and Jiahui Zhang and Li Zhang},
journal= {arXiv preprint arXiv:2312.02934},
year = {2024}
}
备注
ECCV 2024