中文

基于多模态提示的用户友好定制生成

计算机视觉与模式识别 2024-05-28 v1

摘要

文本到图像生成模型取得了显著进步,满足了人们对个性化图像创作日益增长的兴趣。当前的定制技术通常要求用户为每个定制对象提供多张图像(通常为3-5张),以及对这些对象进行分类和描述场景的文本提示。本文质疑这一过程是否可以变得更加用户友好,以及定制是否可以更加复杂。我们提出了一种方法,用户只需为每个定制主题提供图像和文本,并且每个视觉概念仅需一张图像。我们引入了“多模态提示”的概念,这是一种为每个定制概念量身定制的文本和图像的新颖集成,简化了用户交互,并促进了对象和场景的精确定制。我们提出的定制文本到图像生成范式在用户友好性以及使用用户友好输入定制复杂对象的能力方面超越了现有的基于微调的方法。我们的代码可在\href\href{https://github.com/zhongzero/Multi-Modal-Prompt}{https://github.com/zhongzero/Multi-Modal-Prompt}获取。

关键词

引用

@article{arxiv.2405.16501,
  title  = {User-Friendly Customized Generation with Multi-Modal Prompts},
  author = {Linhao Zhong and Yan Hong and Wentao Chen and Binglin Zhou and Yiyi Zhang and Jianfu Zhang and Liqing Zhang},
  journal= {arXiv preprint arXiv:2405.16501},
  year   = {2024}
}

备注

11 pages, 8 figures