OCTraN:非结构化交通场景下的三维占据卷积 Transformer 网络
计算机视觉与模式识别
2023-07-21 v1
摘要
现代自主导航视觉中心环境感知方法广泛采用自监督单目深度估计算法输出视差图。然而,当该视差图投影至三维空间时,视差误差被放大,导致深度估计误差随距相机距离增加而呈二次增长。尽管激光雷达(LiDAR)可解决此问题,但其成本高昂且对许多应用不可行。为应对低成本传感器精确测距的挑战,我们提出 OCTraN——一种采用迭代注意力将二维图像特征转换为三维占据特征,并利用卷积与转置卷积高效处理空间信息的 Transformer 架构。我们还开发了自监督训练流程,通过以提升后单目深度估计获得的伪真值标签替代 LiDAR 真值,使模型泛化至任意场景。
引用
@article{arxiv.2307.10934,
title = {OCTraN: 3D Occupancy Convolutional Transformer Network in Unstructured Traffic Scenarios},
author = {Aditya Nalgunda Ganesh and Dhruval Pobbathi Badrinath and Harshith Mohan Kumar and Priya SS and Surabhi Narayan},
journal= {arXiv preprint arXiv:2307.10934},
year = {2023}
}
备注
This work was accepted as a spotlight presentation at the Transformers for Vision Workshop @CVPR 2023