通过任务分解提升鸟瞰视角语义分割效果
计算机视觉与模式识别
2024-04-03 v1 人工智能
摘要
鸟瞰视角(BEV)语义分割在自动驾驶中发挥着关键作用。以往的方法通常遵循端到端的流程,直接从单目RGB输入预测BEV分割图。然而,RGB输入与BEV目标来自不同视角,使得直接的点到点预测难以优化。本文将原始BEV分割任务分解为两个阶段,即BEV图重建和RGB-BEV特征对齐。在第一个阶段,我们训练一个BEV自编码器,以给定受损噪声潜在表示来重建BEV分割图,从而促使解码器学习典型BEV模式的基本知识。第二个阶段涉及将RGB输入图像映射到第一个阶段的BEV潜在空间,直接在特征层面优化两者之间的相关性。我们的做法将感知与生成的复杂性简化为离散步骤,使模型能够有效处理复杂且具有挑战性的场景。此外,我们提出将BEV分割图从笛卡尔坐标转换为极坐标,以建立RGB图像与BEV图之间的列向对应关系。此方法无需多尺度特征或用于深度估计的相机内参,节省了计算开销。在nuScenes和Argoverse上的大量实验表明,我们的方法在有效性和效率方面均表现出色。代码可在 https://github.com/happytianhao/TaDe 查阅。
引用
@article{arxiv.2404.01925,
title = {Improving Bird's Eye View Semantic Segmentation by Task Decomposition},
author = {Tianhao Zhao and Yongcan Chen and Yu Wu and Tianyang Liu and Bo Du and Peilun Xiao and Shi Qiu and Hongda Yang and Guozhen Li and Yi Yang and Yutian Lin},
journal= {arXiv preprint arXiv:2404.01925},
year = {2024}
}
备注
Accepted by CVPR 2024