细粒度以人为中心文本描述驱动的大场景合成
计算机视觉与模式识别
2023-12-01 v1 人工智能
摘要
文本驱动的大场景图像合成随着扩散模型取得了显著进展,但对其控制仍具挑战性。尽管利用带有对应文本的空间控制已提升了大场景合成的可控性,但在无用户提供控制的情况下忠实反映细粒度文本描述依然困难。为此,我们提出DetText2Scene,一种新颖的文本驱动大尺度图像合成方法,针对细粒度以人为中心文本描述,在全局上下文中具备高忠实度、可控性与自然性。我们的DetText2Scene包含:1)利用大语言模型(LLM)从细粒度描述生成分层关键点-框布局;2)基于视图的条件联合扩散过程,结合LLM生成的基础关键点-框布局由给定细粒度文本合成大场景;3)基于像素扰动的金字塔插值逐步精炼大场景以实现全局一致性。我们的DetText2Scene在文本到大场景合成的定性与定量上均显著优于先前方法,展现出对细粒度描述的强忠实度、优越可控性及优异的全局自然性。
引用
@article{arxiv.2311.18654,
title = {Detailed Human-Centric Text Description-Driven Large Scene Synthesis},
author = {Gwanghyun Kim and Dong Un Kang and Hoigi Seo and Hayeon Kim and Se Young Chun},
journal= {arXiv preprint arXiv:2311.18654},
year = {2023}
}