中文

BeyondScene:基于预训练扩散模型的高分辨率以人为中心场景生成

计算机视觉与模式识别 2024-04-09 v1 人工智能

摘要

生成具有细节和控制的更高分辨率以人为中心的场景对于现有的文本到图像扩散模型仍然是一个挑战。这一挑战源于有限的训练图像尺寸、文本编码器容量(有限的 token)以及生成涉及多人的复杂场景的固有困难。虽然当前方法仅试图解决训练尺寸的限制,但它们生成的以人为中心的场景往往带有严重的伪影。我们提出了 BeyondScene,一种克服先前限制的新颖框架,它利用现有的预训练扩散模型生成精美的高分辨率(超过 8K)以人为中心的场景,具有出色的文本-图像一致性和自然度。BeyondScene 采用分阶段和分层的方法,首先生成一个详细的基础图像,重点关注多人实例创建中的关键元素以及超出扩散模型 token 限制的详细描述,然后无缝地将基础图像转换为更高分辨率的输出,超越训练图像尺寸,并通过我们提出的新型实例感知分层放大过程(包含我们提出的高频注入前向扩散和自适应联合扩散)来结合感知文本和实例的细节。BeyondScene 在与详细文本描述的一致性和自然度方面超越了现有方法,为超越预训练扩散模型容量的高分辨率以人为中心场景创建铺平了道路,且无需昂贵的重新训练。项目页面:https://janeyeon.github.io/beyond-scene。

关键词

引用

@article{arxiv.2404.04544,
  title  = {BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion},
  author = {Gwanghyun Kim and Hayeon Kim and Hoigi Seo and Dong Un Kang and Se Young Chun},
  journal= {arXiv preprint arXiv:2404.04544},
  year   = {2024}
}

备注

Project page: https://janeyeon.github.io/beyond-scene