通过自蒸馏实现 4D 感知的自我提升
计算机视觉与模式识别
2026-04-10 v1
摘要
大规模多视图重建模型取得了显著进展,但大多数现有方法仍依赖完全监督训练,需 Ground-truth 3D/4D 标注。此类标注昂贵且尤其在动态场景中稀缺,限制了可扩展性。我们提出SelfEvo,一个不断使用无标签视频改进预训练多视图重建模型的自我提升框架。SelfEvo引入基于时空上下文不对称性的自蒸馏方案,使其能够在无外部标注的情况下进行基于学习的 4D 感知自我提升。我们系统研究了使自我提升有效的设计选择,包括损失信号、不对称形式及其他训练策略。在跨越八个基准数据集和领域的实验中,SelfEvo 一致地改进了预训练基线,并在不同基础模型(如 VGGT 和 )间普遍适用,尤其在动态场景中取得显著提升。总体而言,SelfEvo 在视频深度估计中实现最高可达 36.5% 的相对提升,在相机估计中实现 20.1% 的提升,且无需使用任何标记数据。项目页面:https://self-evo.github.io/。
引用
@article{arxiv.2604.08532,
title = {Self-Improving 4D Perception via Self-Distillation},
author = {Nan Huang and Pengcheng Yu and Weijia Zeng and James M. Rehg and Angjoo Kanazawa and Haiwen Feng and Qianqian Wang},
journal= {arXiv preprint arXiv:2604.08532},
year = {2026}
}