L-MAGIC:语言模型辅助生成具有连贯性的图像
计算机视觉与模式识别
2024-06-05 v1
摘要
在当前生成式AI突破的时代,从单张输入图像生成全景场景仍然是一个关键挑战。大多数现有方法使用基于扩散的迭代或同步多视角修复。然而,缺乏全局场景布局先验会导致输出质量不佳,出现重复对象(例如,卧室里有多个床),或者需要为每个视角耗时地输入人工文本。我们提出L-MAGIC,一种新颖的方法,利用大型语言模型进行引导,同时扩散360度全景场景的多个连贯视角。L-MAGIC利用预训练的扩散和语言模型而无需微调,确保了零样本性能。通过超分辨率和多视角融合技术进一步提升了输出质量。大量实验表明,与相关工作相比,生成的全景场景具有更好的场景布局和透视图渲染质量,在人工评估中偏好度超过70%。结合条件扩散模型,L-MAGIC可以接受多种输入模态,包括但不限于文本、深度图、草图以及彩色脚本。应用深度估计进一步能够实现3D点云生成和具有流畅相机运动的动态场景探索。代码可在https://github.com/IntelLabs/MMPano获取。视频演示可在https://youtu.be/XDMNEzH4-Ec?list=PLG9Zyvu7iBa0-a7ccNLO8LjcVRAoMn57s获取。
引用
@article{arxiv.2406.01843,
title = {L-MAGIC: Language Model Assisted Generation of Images with Coherence},
author = {Zhipeng Cai and Matthias Mueller and Reiner Birkl and Diana Wofk and Shao-Yen Tseng and JunDa Cheng and Gabriela Ben-Melech Stan and Vasudev Lal and Michael Paulitsch},
journal= {arXiv preprint arXiv:2406.01843},
year = {2024}
}
备注
accepted to CVPR 2024