Splat and Distill:通过三维重建增强教师模型的6面感知蒸馏
计算机视觉与模式识别
2026-02-12 v2
摘要
视觉基础模型(Vision Foundation Models, VFMs)在 various downstream 2D tasks 中取得了显著成功。然而,这些模型常缺乏对三维信息的感知。为此,我们引入Splat and Distill框架,通过为教师模型增添快速的前馈三维重建管道来为其注入强大的三维感知能力。给定教师模型生成的2D特征,我们首先以前馈方式将这些特征提升到显式的3D高斯表示中。随后,这些3D特征通过"splat"操作映射到新视角,生成一组新的2D特征图,用于监督学生模型,从而实现"distilling"几何感知知识。通过取代 prior work 中慢速的 per-scene 优化,我们的框架避免特征平均导致的 artifact,构建教师模型一致性随学生模型同步提升的动态学习过程。在一系列下游任务上进行全面评估,包括单目深度估计、表面法线估计、多视角对应和语义分割。我们的方法在三维感知能力和语义丰富性方面均显著优于 prior work。项目页面可访问 https://davidshavin4.github.io/Splat-and-Distill/。
引用
@article{arxiv.2602.06032,
title = {Splat and Distill: Augmenting Teachers with Feed-Forward 3D Reconstruction For 3D-Aware Distillation},
author = {David Shavin and Sagie Benaim},
journal= {arXiv preprint arXiv:2602.06032},
year = {2026}
}
备注
Accepted to ICLR 2026