中文

无标签神经语义图像合成

计算机视觉与模式识别 2024-07-03 v1 人工智能 机器学习

摘要

近期的工作表明,在控制大型预训练文本到图像扩散模型方面,整合空间条件化取得了很大进展。尽管如此,现有方法要么使用语义模糊(例如边缘)或需要高昂手动标注(例如语义分割)来描述空间图像内容。为克服这些限制,我们提出了一种新的无标签方式,对扩散模型进行条件化,以实现细粒度的空间控制。我们提出了神经语义图像合成的概念,该方法使用从预训练基础模型中提取的神经布局作为条件。神经布局的优势在于,它们提供了对所需图像的丰富描述,包含场景的语义和详细几何信息。我们实验性地表明,通过神经语义图像合成生成的图像在语义类别的像素级对齐方面,与使用昂贵语义标签图相比,效果相似或更好。同时,它们在捕获语义、实例分离和物体方向方面优于其他无标签条件化选项,如边缘或深度。此外,我们表明,神经布局条件化生成的图像可以有效地用于训练各种感知任务的真实数据增强。

关键词

引用

@article{arxiv.2407.01790,
  title  = {Label-free Neural Semantic Image Synthesis},
  author = {Jiayi Wang and Kevin Alexander Laube and Yumeng Li and Jan Hendrik Metzen and Shin-I Cheng and Julio Borges and Anna Khoreva},
  journal= {arXiv preprint arXiv:2407.01790},
  year   = {2024}
}