中文

EscherNet++:通过掩码微调和增强前馈 3D 重建实现同时进行 amodal 完成和可扩展视图合成

计算机视觉与模式识别 2025-07-11 v1

摘要

我们提出了 EscherNet++,一种经过掩码微调的扩散模型,能够以零样本方式合成具有 amodal 完成能力的新颖视图。现有方法利用多个阶段和复杂管道首先幻想图像缺失部分,然后进行新视图合成,这些方法未能考虑跨视图依赖关系,且需要存储和计算资源进行单独阶段。相反,我们应用包括输入级和特征级掩码的掩码微调,以实现端到端模型,增强合成新视图和进行 amodal 完成的能力。此外,我们经验性地将模型与其他 feed-forward image-to-mesh 模型集成,无需额外训练,即可获得具有竞争结果的重建时间缩短 95%,这归功于其合成任意查询视图的能力。我们的方法的可扩展性进一步增强了快速 3D 重建。尽管在较小数据集和 batch size 上进行微调,我们的方法在遮挡任务的 10 输入设置下实现了最先进的结果,将 PSNR 提高 3.9,Volume IoU 提升 0.28,同时也能泛化到真实世界的遮挡重建。

关键词

引用

@article{arxiv.2507.07410,
  title  = {EscherNet++: Simultaneous Amodal Completion and Scalable View Synthesis through Masked Fine-Tuning and Enhanced Feed-Forward 3D Reconstruction},
  author = {Xinan Zhang and Muhammad Zubair Irshad and Anthony Yezzi and Yi-Chang Tsai and Zsolt Kira},
  journal= {arXiv preprint arXiv:2507.07410},
  year   = {2025}
}