SOccDPT:在内存约束下由稠密预测Transformer训练的半监督三维语义占据
计算机视觉与模式识别
2025-01-07 v1 人工智能
摘要
我们提出 SOccDPT,一种利用稠密预测Transformer从单目图像输入进行三维语义占据预测的省内存方法。为解决已有方法在结构化交通数据集上训练的局限,我们在包含 Indian Driving Dataset 和 Bengaluru Driving Dataset 的非结构化数据集上训练模型。我们的半监督训练流程使 SOccDPT 能从标签有限的数据集学习,通过以伪真值标签替代来减少人工标注需求,从而生成我们的 Bengaluru Semantic Occupancy Dataset。这种更广泛的训练增强了模型有效处理非结构化交通场景的能力。为克服训练中的内存限制,我们引入分块训练,每轮仅选取部分参数训练,从而在自动求导图构建时降低内存占用。在非结构化交通及内存受限训练与推理背景下,SOccDPT 优于已有的视差估计方法,其 RMSE 分数为 9.1473,语义分割 IoU 达 46.02%,并以 69.47 Hz 的竞争频率运行。我们公开了代码与语义占据数据集。
引用
@article{arxiv.2311.11371,
title = {SOccDPT: Semi-Supervised 3D Semantic Occupancy from Dense Prediction Transformers trained under memory constraints},
author = {Aditya Nalgunda Ganesh},
journal= {arXiv preprint arXiv:2311.11371},
year = {2025}
}
备注
This work has been submitted to the ICRA 2024 IEEE for possible publication