中文

FlexGen:基于文本和图像输入的灵活多视图生成

计算机视觉与模式识别 2024-10-15 v1 人工智能

摘要

在这项工作中,我们介绍了FlexGen,一个灵活的框架,旨在基于单视图图像、文本提示或两者同时作为条件,生成可控且一致的多视图图像。FlexGen通过额外对3D感知文本注释进行条件控制,来应对可控多视图合成的挑战。我们利用GPT-4V强大的推理能力来生成3D感知文本注释。通过分析排列为平铺多视图图像的一个物体的四个正交视图,GPT-4V可以生成包含具有空间关系的3D信息的文本注释。通过将控制信号与提出的自适应双控制模块集成,我们的模型可以生成与指定文本相对应的多视图图像。FlexGen支持多种可控能力,允许用户修改文本提示以生成合理且对应的未见部分。此外,用户可以影响诸如外观和材质属性(包括金属感和粗糙度)等属性。大量实验表明,我们的方法提供了增强的多重可控性,这标志着对现有扩散模型的一个重要进步。这项工作对于需要快速灵活创建3D内容的领域,包括游戏开发、动画和虚拟现实,具有重要意义。项目页面:https://xxu068.github.io/flexgen.github.io/。

关键词

引用

@article{arxiv.2410.10745,
  title  = {FlexGen: Flexible Multi-View Generation from Text and Image Inputs},
  author = {Xinli Xu and Wenhang Ge and Jiantao Lin and Jiawei Feng and Lie Xu and HanFeng Zhao and Shunsi Zhang and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2410.10745},
  year   = {2024}
}

备注

16 pages, 13 figures