中文

Fin3R:通过单目知识蒸馏对Feed-forward 3D重建模型进行精细调优

计算机视觉与模式识别 2025-12-01 v1

摘要

我们提出Fin3R,一种简单、有效且通用的Feed-forward 3D重建模型精细调优方法。Feed-forward重建模型在单次前向传递中对所有输入图像的点图回归到参考帧坐标系,同时输出其他辅助输出。然而,我们发现当前模型在细节几何和鲁棒性方面存在挑战,原因在于(i)高保真深度和姿态监督稀缺,(ii)多视角点图回归固有的几何错位。Fin3R通过一个额外的轻量级精细调优步骤联合解决上述两个问题。我们冻结负责视角匹配的解码器,仅对专注于特征提取的图像编码器进行调优。编码器通过来自强大的单目教师模型在大规模无标签数据集上的蒸馏获得细节几何信息,采用自定义的轻量级LoRA适配器。我们在广泛的模型上进行验证,包括DUSt3R、MASt3R、CUT3R和VGGT。经调优后的模型在单目和多目设置下均能实现更清晰的边界、恢复复杂结构并实现更高的几何精度,同时仅添加微小的LoRA权重,几乎不影响推理时的内存和延迟。项目页面:https://visual-ai.github.io/fin3r

关键词

引用

@article{arxiv.2511.22429,
  title  = {Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation},
  author = {Weining Ren and Hongjun Wang and Xiao Tan and Kai Han},
  journal= {arXiv preprint arXiv:2511.22429},
  year   = {2025}
}

备注

NeurIPS 2025