中文

PanoFree: 基于跨视图自导引的无调优全景多视图图像生成

计算机视觉与模式识别 2024-08-06 v1

摘要

沉浸式场景生成, 尤其是全景创建, 受益于大型预训练文本到图像(T2I)模型用于多视图图像生成的适应. 由于获取多视图图像成本高昂, 倾向于使用无调优生成. 然而, 现有方法要么受限于简单对应关系, 要么需要广泛微调以捕获复杂对应关系. 我们提出PanoFree, 一种支持广泛对应关系的无调优多视图图像生成方法. PanoFree依次通过迭代变形和填充生成多视图图像, 在无需微调的情况下解决错误累积导致的不一致性和伪影问题. 通过增强跨视图 awareness, 提升变形和填充过程的质量, 采用跨视图引导、危险区域估计与擦除, 以及对称双向引导生成用于闭环, 同时通过基于引导的语义和密度控制以保持场景结构. 在Planar、360度和全球全景实验中, PanoFree显著降低误差, 改善全局一致性, 提升图像质量, 且无需额外微调. 与现有方法相比, PanoFree在时间上高达5倍, 在GPU内存使用上高达3倍, 并在用户研究中保持优异的结果多样性(提升约2倍). PanoFree为使用额外预训练模型或大量微调提供了可行方案. 项目网站位于 https://panofree.github.io/.

关键词

引用

@article{arxiv.2408.02157,
  title  = {PanoFree: Tuning-Free Holistic Multi-view Image Generation with Cross-view Self-Guidance},
  author = {Aoming Liu and Zhong Li and Zhang Chen and Nannan Li and Yi Xu and Bryan A. Plummer},
  journal= {arXiv preprint arXiv:2408.02157},
  year   = {2024}
}

备注

Accepted by ECCV 2024