FineControlNet:通过空间对齐的文本控制注入实现图像生成的细粒度文本控制
计算机视觉与模式识别
2023-12-15 v1
摘要
最近引入的ControlNet能够利用几何输入(如人体2D姿态或边缘特征)来引导文本驱动的图像生成过程。虽然ControlNet提供了对生成图像中实例几何形态的控制,但它缺乏控制每个实例视觉外观的能力。我们提出了FineControlNet,以在保持精确姿态控制能力的同时,提供对每个实例外观的精细控制。具体来说,我们通过人体姿态图像进行几何控制,并通过实例级文本提示进行外观控制,开发并展示了FineControlNet。实例特定文本提示和2D姿态在潜在空间中的空间对齐实现了FineControlNet的精细控制能力。我们通过与最先进的姿态条件文本到图像扩散模型进行严格比较,评估了FineControlNet的性能。与现有方法相比,FineControlNet在生成遵循用户提供的实例特定文本提示和姿态的图像方面取得了优越的性能。项目网页:https://samsunglabs.github.io/FineControlNet-project-page
引用
@article{arxiv.2312.09252,
title = {FineControlNet: Fine-level Text Control for Image Generation with Spatially Aligned Text Control Injection},
author = {Hongsuk Choi and Isaac Kasahara and Selim Engin and Moritz Graule and Nikhil Chavan-Dafle and Volkan Isler},
journal= {arXiv preprint arXiv:2312.09252},
year = {2023}
}
备注
Hongsuk Choi and Isaac Kasahara have eqaul contributions. 19 pages, 15 figures, 3 tables