中文

MZEN:用于相机姿态未知的 3D 重建的多放大增强 NeRF

计算机视觉与模式识别 2025-08-11 v1

摘要

神经光照场(NeRF)方法在从多个 2D 图像进行 3D 重建方面表现优异,即使这些图像的摄像机姿态未知。然而,它们仍然遗漏了在工业检查中重要的细微结构,例如在生产线上检测亚微米缺陷或分析扫描电子显微镜(SEM)中的芯片。在这些场景中,传感器分辨率固定且计算资源有限,因此唯一暴露细微结构的办法是添加放大图像;然而,这会破坏姿态自由 NeRF 训练所依赖的多视图一致性。我们提出了一种多放大增强 NeRF(MZEN),这是一种原生处理多放大图像集的第一个 NeRF 框架。MZEN(i)将针孔相机模型扩展为带有显式可学习放大标量的模型,该标量缩放焦距;(ii)引入一种新颖的姿态策略:先求解宽域图像以建立全局坐标系,然后通过放大一致的裁剪-匹配程序将放大图像姿态定位到最近的宽域图像对应物,再进行联合优化。在八个正向场景——合成 TCAD 模型、真实 SEM 微结构以及 BLEFF 对象——MZEN 均一致优于姿态自由基线方法,甚至优于高分辨率变体,提升 PSNR 最多 2828%,SSIM 最多 1010%,LPIPS 最多降低 222222%。因此,MZEN 将 NeRF 扩展到实际工厂环境,保持全局精度的同时捕获对工业检查至关重要的微米级细节。

关键词

引用

@article{arxiv.2508.05819,
  title  = {MZEN: Multi-Zoom Enhanced NeRF for 3-D Reconstruction with Unknown Camera Poses},
  author = {Jong-Ik Park and Carlee Joe-Wong and Gary K. Fedder},
  journal= {arXiv preprint arXiv:2508.05819},
  year   = {2025}
}