将自我中心三维表示学习建模为光线追踪
计算机视觉与模式识别
2022-08-19 v3
摘要
自动驾驶感知模型旨在从多个相机中共同提取三维语义表示,并转换到自车(ego car)的鸟瞰图(BEV)坐标系,以为下游规划器提供基础。现有感知方法通常依赖于对整个场景易出错的深度估计,或学习缺乏目标几何结构的稀疏虚拟三维表示,二者在性能和/或能力上均存在局限。本文提出一种新颖的端到端架构,用于从任意数量的无约束相机视角中学习自我中心三维表示。受光线追踪原理启发,我们设计了一个由“想象之眼”组成的极化网格作为可学习的自我中心三维表示,并利用自适应注意力机制结合三维到二维投影来表述学习过程。关键在于,该表述无需任何深度监督即可从二维图像中提取丰富的三维表示,且内建的几何结构与BEV保持一致。尽管简单且通用,在标准BEV视觉任务(如基于相机的三维目标检测和BEV分割)上的大量实验表明,我们的模型显著优于所有最先进的替代方法,并因多任务学习而具备计算效率上的额外优势。
引用
@article{arxiv.2206.04042,
title = {Learning Ego 3D Representation as Ray Tracing},
author = {Jiachen Lu and Zheyuan Zhou and Xiatian Zhu and Hang Xu and Li Zhang},
journal= {arXiv preprint arXiv:2206.04042},
year = {2022}
}
备注
ECCV 2022. Code is available at https://github.com/fudan-zvg/Ego3RT