中文

InstructBooth:指令遵循的个性化文本到图像生成

计算机视觉与模式识别 2024-02-16 v2 人工智能

摘要

使用特定对象的有限图像集对文本到图像模型进行个性化处理已在特定主题图像生成中进行了探索。然而,现有方法由于对有限训练图像的过拟合,常常在遵循文本提示方面面临挑战。在这项工作中,我们引入了 InstructBooth,这是一种旨在增强个性化文本到图像模型中图文对齐性而不牺牲个性化能力的新方法。我们的方法首先使用少量特定主题的图像和一个唯一标识符对文本到图像模型进行个性化处理。在个性化之后,我们使用强化学习对个性化文本到图像模型进行微调,以最大化量化图文对齐性的奖励。此外,我们提出了互补技术来增加这两个过程之间的协同作用。与现有基线相比,我们的方法展示了更优的图文对齐性,同时保持了高个性化能力。在人工评估中,综合考虑所有因素时,InstructBooth 优于它们。我们的项目页面位于 https://sites.google.com/view/instructbooth。

关键词

引用

@article{arxiv.2312.03011,
  title  = {InstructBooth: Instruction-following Personalized Text-to-Image Generation},
  author = {Daewon Chae and Nokyung Park and Jinkyu Kim and Kimin Lee},
  journal= {arXiv preprint arXiv:2312.03011},
  year   = {2024}
}