面向三维语义占用预测的时空三视角表示方法
计算机视觉与模式识别
2025-02-18 v3
摘要
对三维场景的整体理解和推理对于自动驾驶系统的成功至关重要。作为自动驾驶和机器人应用预训练任务的三维语义占用预测,其演变相比传统三维检测方法能捕获更精细的三维细节。基于视觉的三维语义占用预测近年来越来越被基于激光雷达(LiDAR)的方法所忽视,后者已展现出优越的性能。然而,我们提出了令人信服的证据,表明增强基于视觉的方法仍有潜力。现有方法主要关注空间线索,如三视角视图(TPV)嵌入,往往忽略了时间线索。本研究引入了S2TPVFormer,这是一种时空Transformer架构,旨在预测时间上连贯的三维语义占用。通过一种新颖的时间跨视图混合注意力机制(TCVHA)引入时间线索,我们生成了时空TPV(S2TPV)嵌入,从而增强了先验过程。在nuScenes数据集上的实验评估表明,与基线TPVFormer相比,三维语义占用的平均交并比(mIoU)绝对提升了+4.1%,验证了S2TPVFormer在推进三维场景感知方面的有效性。
引用
@article{arxiv.2401.13785,
title = {A Spatiotemporal Approach to Tri-Perspective Representation for 3D Semantic Occupancy Prediction},
author = {Sathira Silva and Savindu Bhashitha Wannigama and Gihan Jayatilaka and Muhammad Haris Khan and Roshan Ragel},
journal= {arXiv preprint arXiv:2401.13785},
year = {2025}
}
备注
Accepted to the 2025 Workshop on Machine Learning for Autonomous Driving at AAAI