VersaGen:释放文本到图像合成中的多功能视觉控制
计算机视觉与模式识别
2024-12-31 v3
摘要
尽管文本到图像(T2I)合成取得了快速进展,但实现精确的视觉控制仍然是一个重大挑战。现有工作尝试整合多面控制(文本和草图),旨在增强对生成图像的创造性控制。然而,我们的初步研究表明,人类的表达能力远超当前方法的能力。用户渴望一种更通用的方法,能够适应他们多样化的创作意图,从控制单个主体到操纵整个场景构图。我们提出了VersaGen,一个生成式AI智能体,能够在T2I合成中实现多功能的视觉控制。VersaGen接受四种类型的视觉控制:i) 单个视觉主体;ii) 多个视觉主体;iii) 场景背景;iv) 上述三种的任意组合或完全没有控制。我们在冻结的T2I模型上训练一个适配器,将视觉信息融入文本主导的扩散过程。我们在VersaGen的推理阶段引入了三种优化策略,以改善生成结果并提升用户体验。在COCO和Sketchy上的综合实验验证了VersaGen的有效性和灵活性,定性和定量结果均证明了这一点。
引用
@article{arxiv.2412.11594,
title = {VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis},
author = {Zhipeng Chen and Lan Yang and Yonggang Qi and Honggang Zhang and Kaiyue Pang and Ke Li and Yi-Zhe Song},
journal= {arXiv preprint arXiv:2412.11594},
year = {2024}
}
备注
The paper has been accepted by AAAI 2025. Paper code: https://github.com/FelixChan9527/VersaGen_official