中文

T2I-Adapter:学习适配器以挖掘文本到图像扩散模型更强的可控能力

计算机视觉与模式识别 2023-03-21 v2 人工智能 机器学习 多媒体

摘要

大规模文本到图像(T2I)模型令人难以置信的生成能力已展现出学习复杂结构与有意义语义的强大威力。然而,仅依赖文本提示无法充分利用模型所学到的知识,尤其在需要灵活而精确的控制(如颜色与结构)时。本文旨在“挖掘”T2I 模型已隐式学习的能力,并显式地利用它们进行更细粒度的生成控制。具体而言,我们提出学习简单轻量的 T2I-Adapters,以将 T2I 模型内部知识与外部控制信号对齐,同时冻结原始大型 T2I 模型。由此,我们可根据不同条件训练多种适配器,在实现生成结果颜色与结构的丰富控制与编辑效果。此外,所提 T2I-Adapters 具有组合性与泛化能力等具有实用价值的吸引人特性。大量实验表明,我们的 T2I-Adapter 具有可观的生成质量与广泛应用范围。

关键词

引用

@article{arxiv.2302.08453,
  title  = {T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models},
  author = {Chong Mou and Xintao Wang and Liangbin Xie and Yanze Wu and Jian Zhang and Zhongang Qi and Ying Shan and Xiaohu Qie},
  journal= {arXiv preprint arXiv:2302.08453},
  year   = {2023}
}

备注

Tech Report. GitHub: https://github.com/TencentARC/T2I-Adapter