LoomNet:通过潜在空间编织增强多视图图像生成
计算机视觉与模式识别
2025-07-09 v1
摘要
从单张图像生成一致的多视图图像仍然具有挑战性。空间一致性不足往往会降低表面重建中 3D 网格的质量。为此,我们提出了 LoomNet,一种新的多视图扩散架构,通过在平行中多次应用相同的扩散模型来产生连贯的图像,方法是对共享潜在空间进行协作性构建和利用。每个视图特定的推断会生成一个表示其自身假设的编码,用于给定相机姿态的新视图,然后投射到三个正交平面上。对于每个平面,来自所有视图的编码被融合到单个聚合平面中。然后处理这些聚合平面以传播信息和插值缺失区域,将这些假设整合为统一而连贯的解释。最终的潜在空间然后用于渲染一致的多视图图像。LoomNet 在仅 15 秒内即可生成 16 个高质量且连贯的视图。在我们的实验中,LoomNet 在图像质量和重建指标上均优于最先进的方法,还表现出创造性,通过产生多样且合理的新视图来显示其从相同输入中生成 diverse plausible novel views 的能力。
引用
@article{arxiv.2507.05499,
title = {LoomNet: Enhancing Multi-View Image Generation via Latent Space Weaving},
author = {Giulio Federico and Fabio Carrara and Claudio Gennaro and Giuseppe Amato and Marco Di Benedetto},
journal= {arXiv preprint arXiv:2507.05499},
year = {2025}
}