中文

面向自动驾驶的可扩展基于视觉的三维目标检测与单目深度估计

计算机视觉与模式识别 2024-03-05 v1 机器人学

摘要

本学位论文对基于视觉的三维感知技术的进步做出了多方面的贡献。在第一部分,本文对单目和立体三维目标检测算法均引入了结构性增强。通过将地面参考几何先验集成到单目检测模型中,本研究在单目三维检测的基准评估中实现了无与伦比的准确度。同时,该工作通过整合从单目网络中获得的见解和推理结构,改进了立体三维检测范式,从而提高了立体检测系统的运行效率。第二部分致力于数据驱动策略及其在三维视觉检测中的实际应用。引入了一种新的训练方案,该方案融合了带有 2D 或 3D 标签的数据集。这种方法不仅通过利用大幅扩展的数据集增强了检测模型,而且在只有 2D 标注可用的现实场景中促进了经济的模型部署。最后,本文提出了一种专为自动驾驶场景中的无监督深度估计量身定制的创新流水线。广泛的实证分析证实了这种新提出的流水线的稳健性和有效性。总而言之,这些贡献为基于视觉的三维感知技术在自动驾驶应用中的广泛采用奠定了坚实的基础。

关键词

引用

@article{arxiv.2403.02037,
  title  = {Scalable Vision-Based 3D Object Detection and Monocular Depth Estimation for Autonomous Driving},
  author = {Yuxuan Liu},
  journal= {arXiv preprint arXiv:2403.02037},
  year   = {2024}
}

备注

HKUST PhD Thesis; https://github.com/Owen-Liuyuxuan/visionfactory