中文

Veila: 单目 RGB 图像生成全景激光点云

计算机视觉与模式识别 2025-08-06 v1 机器人学

摘要

真实且可控的全景 LiDAR 数据生成对于可扩展的 3D 感知(尤其是自动驾驶和机器人)至关重要。现有方法要么执行无条件生成,导致可控性差;要么采用文本引导的合成,缺乏细粒度的空间控制。利用单目 RGB 图像作为空间控制信号提供了可扩展且低成本的替代方案,但这仍是开放问题。然而,这面临三个核心挑战:(i) RGB 中的语义和深度线索在空间上存在差异,导致可靠的条件生成复杂;(ii) RGB 外观与 LiDAR 几何之间的模态鸿沟在噪声扩散条件下放大对齐误差;(iii) 在 RGB 与全景 LiDAR 之间维持结构一致性具有挑战性,尤其是在图像和 LiDAR 之间不存在重叠区域时。为此,我们提出了 Veila,一种新型条件扩散框架,集成了:一种 Confidence-Aware Conditioning Mechanism(CACM),通过根据其局部可靠性自适应平衡语义和深度线索来强化 RGB 条件;一种 Geometric Cross-Modal Alignment(GCMA),用于在噪声扩散条件下实现稳健的 RGB-LiDAR 对齐;以及一种 Panoramic Feature Coherence(PFC),用于在单目 RGB 与全景 LiDAR 之间强制全局结构一致性。此外,我们引入了两个指标:Cross-Modal Semantic Consistency(跨模态语义一致性)和 Cross-Modal Depth Consistency(跨模态深度一致性),以评估跨模态对齐质量。在 nuScenes、SemanticKITTI 以及我们提出的 KITTI-Weather benchmark 上进行实验,表明 Veila 在生成保真度和跨模态一致性方面实现了最先进的性能,同时实现了提升下游 LiDAR 语义分割的生成式数据增强。

关键词

引用

@article{arxiv.2508.03690,
  title  = {Veila: Panoramic LiDAR Generation from a Monocular RGB Image},
  author = {Youquan Liu and Lingdong Kong and Weidong Yang and Ao Liang and Jianxiong Gao and Yang Wu and Xiang Xu and Xin Li and Linfeng Li and Runnan Chen and Ben Fei},
  journal= {arXiv preprint arXiv:2508.03690},
  year   = {2025}
}

备注

Preprint; 10 pages, 6 figures, 7 tables