中文

TACOcc:基于体积渲染的目标自适应跨模态融合用于3D语义占据

计算机视觉与模式识别 2025-05-20 v1

摘要

多模态3D占据预测的性能受限于有效融合不足,主要源于固定融合策略导致的几何-语义不匹配以及稀疏、噪声注释导致的表面细节丢失。这种不匹配源于点云和图像特征的异构尺度和分布,导致固定邻域融合下的偏置匹配。为此,我们提出了一种目标尺度自适应的、双向对称检索机制。它为大目标扩展邻域以增强上下文感知,为小目标收缩邻域以提高效率并抑制噪声,从而实现准确的跨模态特征对齐。该机制明确建立空间对应关系并提高融合准确性。对于表面细节丢失,稀疏标签提供的监督有限,导致小目标预测不佳。我们引入基于3D高斯溅写的改进体积渲染管道,该管道以融合特征为输入进行图像渲染,应用光度一致性监督,并联合优化2D-3D一致性。这在抑制噪声传播的同时增强了表面细节重建。总之,我们提出了TACOcc—an基于体积渲染监督增强的3D语义占据预测的自适应多模态融合框架。在nuScenes和SemanticKITTI基准测试上验证了其有效性。

关键词

引用

@article{arxiv.2505.12693,
  title  = {TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy},
  author = {Luyao Lei and Shuo Xu and Yifan Bai and Xing Wei},
  journal= {arXiv preprint arXiv:2505.12693},
  year   = {2025}
}