中文

RadOcc:通过渲染辅助蒸馏学习跨模态占用知识

计算机视觉与模式识别 2023-12-20 v1

摘要

3D 占用预测是一项新兴任务,旨在使用多视图图像估计 3D 场景的占用状态和语义。然而,由于缺乏几何先验,基于图像的场景感知在实现准确预测方面面临重大挑战。在本文中,我们通过探索该任务中的跨模态知识蒸馏来解决这一问题,即我们利用更强的多模态模型在训练期间指导视觉模型。在实践中,我们观察到直接应用在鸟瞰图(BEV)感知中提出并被广泛使用的特征或 logits 对齐,并未产生令人满意的结果。为了克服这一问题,我们引入了 RadOcc,一种用于 3D 占用预测的渲染辅助蒸馏范式。通过采用可微体渲染,我们在透视视图中生成深度和语义图,并提出了教师模型和学生模型渲染输出之间的两种新颖的一致性准则。具体而言,深度一致性损失对齐渲染射线的终止分布,而语义一致性损失则模仿由视觉基础模型(VLM)引导的片段内相似性。在 nuScenes 数据集上的实验结果证明了我们提出的方法在改进各种 3D 占用预测方法方面的有效性,例如,我们提出的方法在 mIoU 指标上使我们的基线提升了 2.2%,并在 Occ3D 基准测试中达到了 50%。

关键词

引用

@article{arxiv.2312.11829,
  title  = {RadOcc: Learning Cross-Modality Occupancy Knowledge through Rendering Assisted Distillation},
  author = {Haiming Zhang and Xu Yan and Dongfeng Bai and Jiantao Gao and Pan Wang and Bingbing Liu and Shuguang Cui and Zhen Li},
  journal= {arXiv preprint arXiv:2312.11829},
  year   = {2023}
}

备注

Accepted by AAAI 2024