视角文本反演:在 2D 扩散模型中发掘场景表示与 3D 视角控制
计算机视觉与模式识别
2024-07-29 v2 人工智能
机器学习
摘要
文本到图像扩散模型可生成令人印象深刻的逼真图像,但它们是否仅从 2D 监督中学习到了 3D 世界的表示?我们证明:是的,诸如 Stable Diffusion 等模型的文本嵌入空间中编码了特定的 3D 场景表示。我们的方法——视角神经文本反演(ViewNeTI)——旨在发现 3D 视角词元;这些词元控制生成图像的 3D 视角(即场景中的渲染位姿)。具体而言,我们训练一个小型神经映射器,接收连续相机视角参数并预测一个视角词元(词嵌入)。该词元通过交叉注意力条件化扩散生成,以产生具有所需相机视角的图像。使用 ViewNeTI 作为评估工具,我们报告两点发现:首先,文本潜空间对特定 3D 场景具有连续的视角控制流形;其次,我们发现了所有场景存在通用视角控制流形的证据。我们得出结论:由于视角词元控制 3D“渲染”视角,冻结的 2D 扩散模型中很可能嵌入了场景表示。最后,我们将 3D 场景表示用于 3D 视觉任务,即视角可控的文本到图像生成以及基于单图像的新视角合成,其中我们的方法在 LPIPS 上树立了最先进水平。代码见 https://github.com/jmhb0/view_neti
引用
@article{arxiv.2309.07986,
title = {Viewpoint Textual Inversion: Discovering Scene Representations and 3D View Control in 2D Diffusion Models},
author = {James Burgess and Kuan-Chieh Wang and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2309.07986},
year = {2024}
}
备注
ECCV 2024 (European Conference on Computer Vision). Project page: https://jmhb0.github.io/view_neti/