中文

通过知识蒸馏提升单视图场景补全的自监督

计算机视觉与模式识别 2024-04-12 v1

摘要

通过运动恢复结构从图像中推断场景几何是计算机视觉中一个长期存在的基础问题。虽然经典方法以及最近的深度图预测仅关注场景的可见部分,但场景补全任务旨在对甚至被遮挡区域的几何进行推理。随着神经辐射场的流行,隐式表示也通过预测所谓的密度场而在场景补全中变得流行。与显式方法(例如基于体素的方法)不同,密度场还允许通过基于图像的渲染进行准确的深度预测和新视图合成。在这项工作中,我们提出融合来自多幅图像的场景重建,并将此知识蒸馏到更准确的单视图场景重建中。为此,我们提出了多视图幕后场景以融合来自多个带位姿图像的密度场,该过程完全仅使用图像数据进行自监督训练。利用知识蒸馏,我们使用 MVBTS 通过直接监督训练了一个名为 KDBTS 的单视图场景补全网络。它在占用预测上实现了 SOTA 性能,特别是在遮挡区域。

关键词

引用

@article{arxiv.2404.07933,
  title  = {Boosting Self-Supervision for Single-View Scene Completion via Knowledge Distillation},
  author = {Keonhee Han and Dominik Muhle and Felix Wimbauer and Daniel Cremers},
  journal= {arXiv preprint arXiv:2404.07933},
  year   = {2024}
}