中文

深度与语义感知的多模态域翻译:从 LiDAR 点云生成 3D 全景彩色图像

计算机视觉与模式识别 2024-03-19 v4

摘要

本文提出一种名为 TITAN-Next 的新型深度与语义感知条件生成模型,用于 LiDAR 与相机传感器间多模态设置下的跨域图像到图像翻译。所提模型利用场景语义作为中间表示,能够仅依靠语义场景分割将原始 LiDAR 点云翻译为 RGB-D 相机图像。我们称这是此类首个框架,并在自动驾驶中具有实际应用,例如提供故障安全机制与增强目标图像域中的可用数据。所提模型在大规模且具挑战性的 Semantic-KITTI 数据集上评估,实验结果表明其在 IoU 指标上以 23.7%\% 的优势显著优于原始 TITAN-Net 与其他强基线。

关键词

引用

@article{arxiv.2302.07661,
  title  = {Depth- and Semantics-aware Multi-modal Domain Translation: Generating 3D Panoramic Color Images from LiDAR Point Clouds},
  author = {Tiago Cortinhal and Eren Erdal Aksoy},
  journal= {arXiv preprint arXiv:2302.07661},
  year   = {2024}
}