中文

细粒度以人为中心文本描述驱动的大场景合成

计算机视觉与模式识别 2023-12-01 v1 人工智能

摘要

文本驱动的大场景图像合成随着扩散模型取得了显著进展,但对其控制仍具挑战性。尽管利用带有对应文本的空间控制已提升了大场景合成的可控性,但在无用户提供控制的情况下忠实反映细粒度文本描述依然困难。为此,我们提出DetText2Scene,一种新颖的文本驱动大尺度图像合成方法,针对细粒度以人为中心文本描述,在全局上下文中具备高忠实度、可控性与自然性。我们的DetText2Scene包含:1)利用大语言模型(LLM)从细粒度描述生成分层关键点-框布局;2)基于视图的条件联合扩散过程,结合LLM生成的基础关键点-框布局由给定细粒度文本合成大场景;3)基于像素扰动的金字塔插值逐步精炼大场景以实现全局一致性。我们的DetText2Scene在文本到大场景合成的定性与定量上均显著优于先前方法,展现出对细粒度描述的强忠实度、优越可控性及优异的全局自然性。

关键词

引用

@article{arxiv.2311.18654,
  title  = {Detailed Human-Centric Text Description-Driven Large Scene Synthesis},
  author = {Gwanghyun Kim and Dong Un Kang and Hoigi Seo and Hayeon Kim and Se Young Chun},
  journal= {arXiv preprint arXiv:2311.18654},
  year   = {2023}
}