FlowSSC:基于单步潜在扩散的通用生成式单目语义场景补全
计算机视觉与模式识别
2026-01-22 v1 机器人学
摘要
由于从单一视角推断被遮挡 3D 几何的固有模糊性,从单目 RGB 图像进行语义场景补全是一项基础且具挑战性的任务。尽管前馈方法已取得进展,但它们通常难以在被遮挡区域生成合理的细节并保持物体间的根本空间关系。这种对整个 3D 空间的精确生成推理能力在实际应用中至关重要。在本文中,我们提出了 FlowSSC,这是首个直接应用于单目语义场景补全的生成式框架。FlowSSC 将 SSC 任务视为一个条件生成问题,并可与现有的前馈 SSC 方法无缝集成以显著提升其性能。为了在不牺牲质量的前提下实现实时推理,我们引入了在紧凑三平面潜在空间中运行的 Shortcut Flow-matching。与需要数百步的标准扩散模型不同,我们的方法利用快捷机制在单步内实现高保真生成,从而能够在自动系统中实际部署。在 SemanticKITTI 上的大量实验表明,FlowSSC 达到了 SOTA 性能,显著优于现有基线。
引用
@article{arxiv.2601.15250,
title = {FlowSSC: Universal Generative Monocular Semantic Scene Completion via One-Step Latent Diffusion},
author = {Zichen Xi and Hao-Xiang Chen and Nan Xue and Hongyu Yan and Qi-Yuan Feng and Levent Burak Kara and Joaquim Jorge and Qun-Ce Xu},
journal= {arXiv preprint arXiv:2601.15250},
year = {2026}
}
备注
Under Review