中文

面向文本到图像生成的定制助手

计算机视觉与模式识别 2024-05-10 v2

摘要

定制预训练文本到图像生成模型因其在现实应用中的巨大潜力,近期引起了广泛的研究兴趣。尽管现有方法能够为用户输入的单一图像中包含的新概念生成创意内容,但其能力仍远未达到完美。具体而言,大多数现有方法需要在测试图像上微调生成模型。一些现有方法无需微调,但其性能不尽如人意。此外,用户与模型之间的交互仍局限于指令和描述等指令性和描述性提示。在本工作中,我们基于预训练大语言模型和扩散模型构建了一个定制助手,它不仅能够以免调优的方式执行定制生成,还能实现更友好的用户交互:用户可以与助手聊天,并输入模糊文本或清晰指令。具体来说,我们提出了一个由新模型设计和新颖训练策略组成的新框架。由此产生的助手可以在2-5秒内完成定制生成,无需任何测试时微调。我们进行了大量实验,在不同领域均取得了有竞争力的结果,证明了所提方法的有效性。

关键词

引用

@article{arxiv.2312.03045,
  title  = {Customization Assistant for Text-to-image Generation},
  author = {Yufan Zhou and Ruiyi Zhang and Jiuxiang Gu and Tong Sun},
  journal= {arXiv preprint arXiv:2312.03045},
  year   = {2024}
}

备注

CVPR 2024