中文

基于知识蒸馈的多视角3D重建

计算机视觉与模式识别 2026-02-20 v2 人工智能 机器学习

摘要

大型基础模型如Dust3r可以given立体图像对作为输入,产生高质量的输出,如点图、相机内参和深度估计。然而,这些输出在诸如视觉定位等任务中应用时需要大量的推理时间和计算资源。为了解决这些限制,我们提出使用知识蒸馈管道,其中我们旨在以Dust3r作为教师,探索多个学生模型的架构,这些学生模型是使用Dust3r输出的3D重建点进行训练的。我们的目标是构建能够学习场景特定表示并以可复制的性能输出3D点(如Dust3r)的学生模型。我们用于训练模型的数据集是12Scenes。我们测试了两种主要模型架构:一种是基于CNN的架构,另一种是基于视觉转换器的架构。对于每种架构,我们还比较了使用预训练模型与从头构建的模型。我们对比了学生模型输出的重建3D点与Dust3r的结果,并讨论了学生模型所学习的各种特征。我们还通过超参数调优对模型进行消融研究。总体而言,我们观察到视觉转换器在视觉上和量化上都表现出最佳性能。

关键词

引用

@article{arxiv.2412.02039,
  title  = {Multi-View 3D Reconstruction using Knowledge Distillation},
  author = {Aditya Dutt and Ishikaa Lunawat and Manpreet Kaur},
  journal= {arXiv preprint arXiv:2412.02039},
  year   = {2026}
}

备注

6 pages, 10 figures