中文

从多视图扩散器进行优化的视图与几何蒸馏

计算机视觉与模式识别 2025-05-14 v4

摘要

使用图像条件扩散模型从单个输入视图生成多视图图像是近期的一项进展,并显示出巨大潜力。然而,合成视图缺乏一致性以及提取的几何过于平滑等问题依然存在。先前的方法集成了多视图一致性模块或施加额外的监督以增强视图一致性,但牺牲了相机定位的灵活性并限制了视图合成的通用性。在本研究中,我们将几何提取过程中优化的辐射场视为比先前工作中使用的体积和射线聚合更严格的先验一致性。我们进一步识别并纠正了传统辐射场优化过程中通过多视图扩散器进行分数蒸馏时存在的一个关键偏差。我们引入了一种无偏分数蒸馏(USD),它利用来自 2D 扩散模型的无条件噪声,极大地细化了辐射场的保真度。我们利用优化后的辐射场渲染的视图作为基础,并开发了一个两步专业化过程的 2D 扩散模型,该模型擅长执行特定对象的去噪并生成高质量的多视图图像。最后,我们直接从细化的多视图图像中恢复出忠实的几何和纹理。实证评估表明,我们优化的几何与视图蒸馏技术生成的结果可与在广泛数据集上训练的最先进模型相媲美,同时保持了相机定位的自由度。请访问我们的项目页面:https://youjiazhang.github.io/USD/。

关键词

引用

@article{arxiv.2312.06198,
  title  = {Optimized View and Geometry Distillation from Multi-view Diffuser},
  author = {Youjia Zhang and Zikai Song and Junqing Yu and Yawei Luo and Wei Yang},
  journal= {arXiv preprint arXiv:2312.06198},
  year   = {2025}
}

备注

IJCAI 2025. Project page: https://youjiazhang.github.io/USD/