TFusionOcc:基于 T 原始素的面向对象的多传感器融合框架用于 3D 占用预测
计算机视觉与模式识别
2026-04-22 v2 人工智能
机器人学
摘要
3D 语义占用预测使自动驾驶车辆(AVs)能够感知细粒度的几何和语义场景结构,以实现安全的导航和决策。现有方法主要依赖基于体素的表示,导致在空旷区域产生冗余计算,或依赖于面向对象的高斯原始素,受限于对复杂非凸和非对称结构的建模能力。本文提出 TFusionOcc,一个基于 T 原始素的面向对象多传感器融合框架,用于 3D 语义占用预测。具体而言,我们引入了基于 Student t 分布的 T 原始素系列,包括普通 T 原始素、T 超椭球体和带逆向扭曲的可变形 T 超椭球体,其中可变形 T 超椭球体是关键的几何增强原始素。我们进一步开发了基于 Student t 分布和 T 混合模型(TMM)的统一概率表述,以联合建模占用和语义,并设计了紧密耦合的多阶段融合架构以有效整合摄像头和 LiDAR 线索。广泛的 nuScenes 实验表明 TFusionOcc 实现了最佳性能,同时在 nuScenes-C 上的额外评估显示其在大多数损坏情景下都具有强大的鲁棒性。代码将在 https://github.com/DanielMing123/TFusionOcc 上提供。
引用
@article{arxiv.2602.06400,
title = {TFusionOcc: T-Primitive Based Object-Centric Multi-Sensor Fusion Framework for 3D Occupancy Prediction},
author = {Zhenxing Ming and Yaoqi Huang and Julie Stephany Berrio and Mao Shan and Stewart Worrall},
journal= {arXiv preprint arXiv:2602.06400},
year = {2026}
}