中文

CurriFlow:基于光流的时序对齐与课程引导深度融合的 3D 语义场景完成

计算机视觉与模式识别 2025-10-15 v1

摘要

语义场景完成 (SSC) 旨在从单目图像推断完整的 3D 几何与语义信息,作为基于摄像头的自动驾驶感知能力的关键技术。然而,现有 SSC 方法依赖时序堆叠或深度投影,缺乏显式的运动推理,难以处理遮挡问题和噪声深度监督。我们提出 CurriFlow,一种新颖的语义占据预测框架,集成光流驱动的时序对齐与课程引导的深度融合。CurriFlow 采用多层融合策略,利用预训练光流对分割、视觉和深度特征在帧之间进行对齐,从而提高时序一致性和动态物体理解。为增强几何鲁棒性,课程学习机制在训练期间逐渐从稀疏而准确的 LiDAR 深度过渡到稠密但噪声较大的立体深度,确保优化稳定并顺利适应实际部署。此外,来自 Segment Anything Model (SAM) 的语义先验提供类别无关的监督,强化了体素级语义学习和空间一致性。在 SemanticKITTI 数据集上进行的实验表明,CurriFlow 以平均 IoU 16.9 的性能实现了最先进的水平,验证了本方法在基于摄像头的 3D 语义场景完成中具备动力学引导和课程感知优势。

关键词

引用

@article{arxiv.2510.12362,
  title  = {CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion},
  author = {Jinzhou Lin and Jie Zhou and Wenhao Xu and Rongtao Xu and Changwei Wang and Shunpeng Chen and Kexue Fu and Yihua Shao and Li Guo and Shibiao Xu},
  journal= {arXiv preprint arXiv:2510.12362},
  year   = {2025}
}