中文

HiPrompt:基于分层多模态大语言模型提示的无微调高分辨率生成

计算机视觉与模式识别 2024-09-10 v3

摘要

利用预训练扩散模型进行高分辨率图像生成的潜力巨大,然而这些模型常常面临物体重复和结构伪影的问题,尤其是在将分辨率提升至 4K 及更高时。我们发现该问题在于,使用单一提示生成多个尺度无法提供充分的效能。为此,我们提出 HiPrompt,一种通过引入分层提示来解决上述问题的新型无微调解决方案。分层提示同时提供全局和局部引导。具体而言,全局引导来自描述整体内容的用户输入,而局部引导则利用来自 MLLM 的图像块描述来精细引导区域结构与纹理生成。此外,在逆去噪过程中,生成的噪声被分解为低频和高频空间分量。这些分量以多个提示级别为条件,包括详细的图像块描述和更广泛的图像级提示,从而促进在分层语义引导下的提示引导去噪。这进一步使生成过程更关注局部空间区域,并确保生成的图像保持连贯的局部与全局语义、结构和高清纹理。大量实验表明,HiPrompt 在高分辨率图像生成中优于 SOTA 工作,显著减少了物体重复并提升了结构质量。

关键词

引用

@article{arxiv.2409.02919,
  title  = {HiPrompt: Tuning-free Higher-Resolution Generation with Hierarchical MLLM Prompts},
  author = {Xinyu Liu and Yingqing He and Lanqing Guo and Xiang Li and Bu Jin and Peng Li and Yan Li and Chi-Min Chan and Qifeng Chen and Wei Xue and Wenhan Luo and Qifeng Liu and Yike Guo},
  journal= {arXiv preprint arXiv:2409.02919},
  year   = {2024}
}

备注

https://liuxinyv.github.io/HiPrompt/