DualDiff:面向自动驾驶的语义融合双分支扩散模型
计算机视觉与模式识别
2025-05-06 v1
摘要
高保真度的驾驶场景重建依赖于充分利用场景信息作为条件。然而,现有方法主要使用 3D 边界框和二值图进行前景和背景控制,难以捕捉场景的复杂性并整合多模态信息。本文提出 DualDiff,一种双分支条件扩散模型,旨在增强多视图驾驶场景生成。我们引入了一种富含语义的 3D 表示——占用射线采样(Occupancy Ray Sampling, ORS),并结合数值化驾驶场景表示,以实现全面的前景和背景控制。为改善跨模态信息集成,我们提出了一种语义融合注意力(Semantic Fusion Attention, SFA)机制,用于对齐和融合不同模态的特征。此外,我们设计了一种前景感知掩码(Foreground-Aware Masked, FGM)损失,以增强微小物体的生成。DualDiff 在 FID 分数上达到了最先进的性能,并在下游的 BEV 分割和 3D 目标检测任务中持续取得更优结果。
引用
@article{arxiv.2505.01857,
title = {DualDiff: Dual-branch Diffusion Model for Autonomous Driving with Semantic Fusion},
author = {Haoteng Li and Zhao Yang and Zezhong Qian and Gongpeng Zhao and Yuqi Huang and Jun Yu and Huazheng Zhou and Longjun Liu},
journal= {arXiv preprint arXiv:2505.01857},
year = {2025}
}
备注
8 pages, 6 figures,