DriveEditor:面向可控驾驶场景中物体编辑的统一3D信息引导框架
计算机视觉与模式识别
2024-12-31 v2
摘要
以视觉为中心的自动驾驶系统需要多样化的数据以进行稳健的训练和评估,通过操作现有场景捕获中的物体位置和外观来实现数据增强。尽管扩散模型的最新进展在视频编辑方面显示出前景,但其在驾驶场景中进行物体操作仍面临位置不精确和难以保持高保真物体外观的挑战。为解决位置和外观控制方面的这些挑战,我们引入了DriveEditor,这是一个基于扩散模型的驾驶视频物体编辑框架。DriveEditor提供了一个统一的框架,用于全面的物体编辑操作,包括重新定位、替换、删除和插入。这些多样化的操作都通过共享的输入集合实现,这些输入由相同的定位控制和外观维护模块处理。定位控制模块在保持深度信息的同时,将给定的3D边界框分层注入扩散过程,从而实现对物体位置和姿态的精确控制。外观维护模块通过采用三级方法来保持一致的属性:低层细节保持、高层语义维护以及来自新视角合成模型的3D先验的集成。在nuScenes数据集上进行的大量定性和定量评估表明,DriveEditor在生成多样化驾驶场景编辑方面具有卓越的保真度和可控性,以及在促进下游任务方面的显著能力。项目页面:https://yvanliang.github.io/DriveEditor。
引用
@article{arxiv.2412.19458,
title = {DriveEditor: A Unified 3D Information-Guided Framework for Controllable Object Editing in Driving Scenes},
author = {Yiyuan Liang and Zhiying Yan and Liqun Chen and Jiahuan Zhou and Luxin Yan and Sheng Zhong and Xu Zou},
journal= {arXiv preprint arXiv:2412.19458},
year = {2024}
}
备注
AAAI 2025