Text2Street:面向街景的可控文本到图像生成
计算机视觉与模式识别
2024-02-08 v1
摘要
随着扩散模型的出现,文本到图像生成取得了显著进展。然而,基于文本生成街景图像仍然是一项困难的任务,主要因为街景的道路拓扑复杂、交通状态多样且天气条件多变,这使得传统的文本到图像模型难以处理。为了应对这些挑战,我们提出了一种名为 \textbf{Text2Street} 的新型可控文本到图像框架。在该框架中,我们首先引入了车道感知道路拓扑生成器,它配备了计数适配器,实现了具有准确道路结构和车道线的文本到地图生成,实现了可控的道路拓扑生成。然后,提出了基于位置的对象布局生成器,通过对象级边界框扩散策略获得文本到布局生成,实现了可控的交通对象布局生成。最后,设计了多控制图像生成器,以整合道路拓扑、对象布局和天气描述,实现可控的街景图像生成。大量实验表明,所提出的方法实现了可控的街景文本到图像生成,并验证了 Text2Street 框架对街景的有效性。
引用
@article{arxiv.2402.04504,
title = {Text2Street: Controllable Text-to-image Generation for Street Views},
author = {Jinming Su and Songen Gu and Yiting Duan and Xingyue Chen and Junfeng Luo},
journal= {arXiv preprint arXiv:2402.04504},
year = {2024}
}