HorizonWeaver:驾驶场景的可泛化多级语义编辑
计算机视觉与模式识别
2026-04-07 v1
摘要
确保自动驾驶安全需要可扩展地生成真实、可控的驾驶场景,超越实际测试所能提供的。然而,现有基于指令引导的图像编辑器,训练于以物体为中心或艺术性数据,在密集的、安全关键型驾驶布局上表现不佳。我们提出了 HorizonWeaver,它解决了驾驶场景编辑中的三个基本挑战:(1) 多级粒度,要求在密集环境中保持对象和场景级别编辑的一致性;(2) 丰富的高层语义,在遵循详细指令的同时保留多样化对象;(3) 普遍存在的域偏移,处理未见环境中的气候、布局和交通变化。HorizonWeaver 的核心是一系列跨数据、模型和训练的互补贡献:(1) 数据:大规模数据集生成,我们从 Boreas、nuScenes 和 Argoverse2 构建配对的真实/合成数据集以改善泛化;(2) 模型:语言引导的掩码,用于精细编辑,其中语义丰富的掩码和提示实现了精确的语言引导编辑;(3) 训练:内容保留和指令对齐,其中联合损失强制场景一致性和指令保真度。综合而言,HorizonWeaver 为复杂驾驶场景的光真实、指令驱动编辑提供了一个可扩展框架,在 13 个编辑类别中收集了 255K 图像,在 L1、CLIP 和 DINO 指标上超越了先前方法,实现了 +46.4% 的用户偏好,并将 BEV 分割 IoU 提高了 +33%。项目页面:https://msoroco.github.io/horizonweaver/
引用
@article{arxiv.2604.04887,
title = {HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes},
author = {Mauricio Soroco and Francesco Pittaluga and Zaid Tasneem and Abhishek Aich and Bingbing Zhuang and Wuyang Chen and Manmohan Chandraker and Ziyu Jiang},
journal= {arXiv preprint arXiv:2604.04887},
year = {2026}
}
备注
CVPR Findings 2026