驾驶即 DINO:视觉基础特征作为仿真-真实生成自主驾驶的统一桥梁
计算机视觉与模式识别
2026-02-10 v2
摘要
受可控视频扩散涌现的驱动,现有的仿真-真实方法用于自主驾驶视频生成通常依赖显式的中间表示来弥合领域差距。然而,这些模态面临根本性的一致性-真实性困境。低层信号(如边缘、模糊图像)确保精确控制但以“烘焙”合成伪影损害真实性,而高层先验(如深度、语义、HD 地图)促进照明 realism 但缺乏足够结构细节以实现一致的指导。本文提出驾驶即 DINO (DwD),一种新框架利用视觉基础模块 (VFM) 特征作为仿真与真实世界域之间的统一桥梁。我们首先识别到这些特征编码了从高级语义到细粒度结构的 spectrum 信息。为有效利用它们,我们采用主子空间投影抛弃负责“纹理烘焙”的高频元素,同时引入随机通道尾部丢弃以缓解刚性降维固有的结构损失,从而在真实性与控制一致性之间取得平衡。为充分利用 DINOv3 的高分辨率能力以提升控制精度,我们引入可学习的空间对齐模块,将这些高分辨率特征适配到扩散主干。最后,我们提出因果时序聚合器,利用因果卷积在整合帧级 DINO 特征时显式保留历史运动上下文,从而有效缓解运动模糊并保证时序稳定性。项目页面: https://albertchen98.github.io/DwD-project/
引用
@article{arxiv.2602.06159,
title = {Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving},
author = {Xuyang Chen and Conglang Zhang and Chuanheng Fu and Zihao Yang and Kaixuan Zhou and Yizhi Zhang and Jianan He and Yanfeng Zhang and Mingwei Sun and Zengmao Wang and Zhen Dong and Xiaoxiao Long and Liqiu Meng},
journal= {arXiv preprint arXiv:2602.06159},
year = {2026}
}
备注
Project website https://albertchen98.github.io/DwD-project/