中文

NERF 在少样本 3D 重建中使用预训练视觉特征的局限性

计算机视觉与模式识别 2025-06-24 v1

摘要

神经辐射场 (NeRF) 已彻底革新了从稀疏图像集合进行 3D 场景重建。近期研究探索了将预训练视觉特征(特别是来自 DINO 的特征)集成以增强少样本重建能力。然而,这些方法的有效性仍不明朗,尤其在极端少样本情境下。本文对 DINO 增强型 NeRF 模型进行系统评估,比较基线 NeRF、冻结 DINO 特征、LoRA 微调特征以及多尺度特征融合。意外结果显示,所有 DINO 变体的 PSNR 值约为 12.9 到 13.0,而基线 NeRF 为 14.71。这一反直觉结果表明,预训练视觉特征可能对少样本 3D 重建没有帮助,甚至可能引入有害偏差。我们分析潜在原因,包括特征-任务不匹配、对有限数据过拟合以及集成挑战。我们的发现挑战了该领域的常见假设,表明更简洁的、专注于几何一致性的架构在少样本情境下可能更有效。

关键词

引用

@article{arxiv.2506.18208,
  title  = {Limitations of NERF with pre-trained Vision Features for Few-Shot 3D Reconstruction},
  author = {Ankit Sanjyal},
  journal= {arXiv preprint arXiv:2506.18208},
  year   = {2025}
}

备注

5 pages, 1 table, 2 figures. First submission. Code available at: \url{https://github.com/ANKITSANJYAL/nerf-few-shot-limitations}