基于奖励引导的 DualDiff:高保真视频生成的双分支扩散模型
计算机视觉与模式识别
2025-03-06 v1
摘要
准确且高保真的驾驶场景重建要求有效利用综合场景信息作为条件输入。现有方法主要依赖 3D 边界框和 BEV 道路图进行前景和背景控制,无法捕捉驾驶场景的全部复杂性,也不足以集成多模态信息。本文提出 DualDiff,一种双分支条件扩散模型,旨在增强跨多个视角和视频序列的驾驶场景生成。具体而言,我们引入占据射线-形状抽样(ORS)作为条件输入,提供丰富的前景和背景语义以及 3D 空间几何,以精确控制前景和背景的生成。为提高对细粒度前景对象(尤其是复杂且远处的对象)的合成效果,我们提出了前景感知掩码(FGM)去噪损失函数。此外,我们开发了语义融合注意力(SFA)机制,以动态优先排序相关信息并抑制噪声,从而实现更有效的多模态融合。最后,为确保图像到视频的高质量生成,我们引入了奖励引导扩散(RGD)框架,维持生成视频的全局一致性和语义连贯性。大量实验表明,DualDiff 在多个数据集上实现了状态的最佳(SOTA)性能。在 NuScenes 数据集上,DualDiff 比最佳基线降低了 4.09% 的 FID 分数。在下游任务中,如 BEV 分段,我们的方法将车辆 mIoU 提升 4.50%,道路 mIoU 提升 1.70%;在 BEV 3D 对象检测中,前景 mAP 提升 1.46%。代码将在 https://github.com/yangzhaojason/DualDiff 上发布。
引用
@article{arxiv.2503.03689,
title = {DualDiff+: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance},
author = {Zhao Yang and Zezhong Qian and Xiaofan Li and Weixiang Xu and Gongpeng Zhao and Ruohong Yu and Lingsi Zhu and Longjun Liu},
journal= {arXiv preprint arXiv:2503.03689},
year = {2025}
}