IFAdapter:面向基于文本的图像生成中实例特征控制的适配器
计算机视觉与模式识别
2024-11-07 v3 人工智能
摘要
尽管文本到图像(T2I)扩散模型在生成单个实例的视觉吸引力图像方面表现出色,但它们在准确定位和控制多个实例的特征生成方面仍存在困难。布局到图像(L2I)任务通过引入边界框作为空间控制信号来解决定位挑战,但在生成精确的实例特征方面仍有不足。为此,我们提出实例特征生成(IFG)任务,旨在确保生成实例的定位准确性和特征保真度。为解决 IFG 任务,我们引入了实例特征适配器(IFAdapter)。IFAdapter 通过引入额外的外观 token 并利用实例语义图将实例级特征与空间位置对齐,从而增强特征描述。IFAdapter 作为即插即用模块引导扩散过程,使其能适应各种社区模型。在评估方面,我们贡献了一个 IFG 基准,并开发了一条验证流程以客观比较模型生成具有准确定位和特征的实例的能力。实验结果表明,IFAdapter 在定量和定性评估中均优于其他模型。
引用
@article{arxiv.2409.08240,
title = {IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation},
author = {Yinwei Wu and Xianpan Zhou and Bing Ma and Xuefeng Su and Kai Ma and Xinchao Wang},
journal= {arXiv preprint arXiv:2409.08240},
year = {2024}
}