Mirage:用于驾驶场景中逼真且连贯的资产编辑的一步式视频扩散模型
计算机视觉与模式识别
2026-01-01 v1
摘要
以视觉为中心的自动驾驶系统依赖于多样且可扩展的训练数据来实现鲁棒的性能。虽然视频对象编辑为数据增强提供了一条有前景的路径,但现有方法往往难以同时保持高视觉保真度和时间连贯性。在这项工作中,我们提出了Mirage,这是一种用于驾驶场景中逼真且连贯的资产编辑的一步式视频扩散模型。Mirage建立在文本到视频扩散先验之上,以确保跨帧的时间一致性。然而,3D因果变分自编码器常因压缩而导致空间保真度下降,并且直接将3D编码器特征传递给解码器层会破坏时间因果性。为了解决这个问题,我们将来自预训练2D编码器的时间无关潜在变量注入到3D解码器中,以在保留因果结构的同时恢复细节。此外,由于场景对象和插入的资产是在不同目标下优化的,它们的高斯分布表现出分布不匹配,从而导致姿态不对齐。为了缓解这个问题,我们引入了一种结合粗略3D对齐和精细2D细化的两阶段数据对齐策略,从而改善对齐并提供更干净的监督信号。大量实验表明,Mirage在多种编辑场景中实现了高真实感和时间一致性。除了资产编辑,Mirage还可以泛化到其他视频到视频的转换任务,作为未来研究的可靠基线。我们的代码可在https://github.com/wm-research/mirage获取。
引用
@article{arxiv.2512.24227,
title = {Mirage: One-Step Video Diffusion for Photorealistic and Coherent Asset Editing in Driving Scenes},
author = {Shuyun Wang and Haiyang Sun and Bing Wang and Hangjun Ye and Xin Yu},
journal= {arXiv preprint arXiv:2512.24227},
year = {2026}
}