中文

基于体素几何对应性的时间融合 3D 占据预测

计算机视觉与模式识别 2024-09-26 v3 人工智能

摘要

基于单目视觉的 3D 占据预测面临深度估计固有局限性。为提高 3D 占据预测精度,本文提出 CVT-Occ 方法,利用体素在时间上的几何对应性进行时序融合。通过对每个体素的视线沿线路上的点进行采样,并整合历史帧中这些点的特征,我们构建体素成本体积特征图,以细化当前体素特征以获得更好的预测结果。我们利用历史观测中的视差线索,并采用数据驱动方法学习体素成本。通过在 Occ3D-Waymo 数据集上的严格实验,我们验证了 CVT-Occ 的有效性,该方法在 3D 占据预测任务中超越了当前最先进的方法,同时额外计算成本最小。代码已发布于 \url{https://github.com/Tsinghua-MARS-Lab/CVT-Occ}。

关键词

引用

@article{arxiv.2409.13430,
  title  = {CVT-Occ: Cost Volume Temporal Fusion for 3D Occupancy Prediction},
  author = {Zhangchen Ye and Tao Jiang and Chenfeng Xu and Yiming Li and Hang Zhao},
  journal= {arXiv preprint arXiv:2409.13430},
  year   = {2024}
}

备注

Accepted to ECCV 2024