中文

VIBUS:基于视点瓶颈与不确定性谱建模的数据高效三维场景解析

计算机视觉与模式识别 2022-10-21 v1 人工智能

摘要

近年来,基于深度学习的三维场景解析是一个热点话题。然而,当前全监督模型的方法需要逐点人工标注监督,获取极其不友好且耗时。因此,以稀疏监督训练三维场景解析模型是一个引人关注的替代方案。我们将此任务称为数据高效三维场景解析,并提出一个名为VIBUS的有效两阶段框架,通过利用海量未标注点来解决该问题。在第一阶段,我们使用提出的视点瓶颈(Viewpoint Bottleneck)损失函数对未标注点进行自监督表示学习。该损失函数源自对不同视点下场景施加的信息瓶颈目标,使表示学习过程免于退化与采样。在第二阶段,基于不确定性谱建模从稀疏标签中生成伪标签。通过结合数据驱动的不确定性度量与三维网格谱度量(源自法线方向与测地距离),获得鲁棒的局部亲和度度量。采用有限gamma/beta混合模型分解这些度量的类别分布,实现阈值的自动选取。我们在公开基准ScanNet上评估VIBUS,在验证集与在线测试服务器上均取得最先进结果。消融研究表明视点瓶颈与不确定性谱建模均带来显著提升。代码与模型公开于 https://github.com/AIR-DISCOVER/VIBUS。

关键词

引用

@article{arxiv.2210.11472,
  title  = {VIBUS: Data-efficient 3D Scene Parsing with VIewpoint Bottleneck and Uncertainty-Spectrum Modeling},
  author = {Beiwen Tian and Liyi Luo and Hao Zhao and Guyue Zhou},
  journal= {arXiv preprint arXiv:2210.11472},
  year   = {2022}
}

备注

Accepted to ISPRS Journal of Photogrammetry and Remote Sensing, Code: https://github.com/AIR-DISCOVER/VIBUS