中文

LoomNet:通过潜在空间编织增强多视图图像生成

计算机视觉与模式识别 2025-07-09 v1

摘要

从单张图像生成一致的多视图图像仍然具有挑战性。空间一致性不足往往会降低表面重建中 3D 网格的质量。为此,我们提出了 LoomNet,一种新的多视图扩散架构,通过在平行中多次应用相同的扩散模型来产生连贯的图像,方法是对共享潜在空间进行协作性构建和利用。每个视图特定的推断会生成一个表示其自身假设的编码,用于给定相机姿态的新视图,然后投射到三个正交平面上。对于每个平面,来自所有视图的编码被融合到单个聚合平面中。然后处理这些聚合平面以传播信息和插值缺失区域,将这些假设整合为统一而连贯的解释。最终的潜在空间然后用于渲染一致的多视图图像。LoomNet 在仅 15 秒内即可生成 16 个高质量且连贯的视图。在我们的实验中,LoomNet 在图像质量和重建指标上均优于最先进的方法,还表现出创造性,通过产生多样且合理的新视图来显示其从相同输入中生成 diverse plausible novel views 的能力。

关键词

引用

@article{arxiv.2507.05499,
  title  = {LoomNet: Enhancing Multi-View Image Generation via Latent Space Weaving},
  author = {Giulio Federico and Fabio Carrara and Claudio Gennaro and Giuseppe Amato and Marco Di Benedetto},
  journal= {arXiv preprint arXiv:2507.05499},
  year   = {2025}
}