中文

面向个性化文本到图像生成的可控文本反演

计算机视觉与模式识别 2023-09-26 v3 人工智能 计算与语言 机器学习

摘要

近期的大规模生成式建模取得了前所未有的性能,尤其在由文本提示驱动生成高保真图像方面。文本反演(TI)连同文本到图像模型主干,被提出作为一种在提示包含用户定义的、未见过的或长尾概念词元时实现生成个性化的有效技术。尽管如此,我们发现并表明 TI 的部署仍充满“黑魔法”——举几个例子:对额外数据集的严苛要求、循环中艰巨的人力投入以及缺乏鲁棒性。在本工作中,我们提出了大幅增强版的 TI,称为 Controllable Textual Inversion(可控文本反演,COTI),解决了上述所有问题,进而提供一个鲁棒、数据高效且易用的框架。COTI 的核心是一个理论引导的损失目标,由全面新颖的加权评分机制实例化,并封装于主动学习范式之中。大量结果表明,COTI 显著优于先前的 TI 相关方法,FID 分数降低 26.05,R 精度提升 23.00%。

关键词

引用

@article{arxiv.2304.05265,
  title  = {Controllable Textual Inversion for Personalized Text-to-Image Generation},
  author = {Jianan Yang and Haobo Wang and Yanming Zhang and Ruixuan Xiao and Sai Wu and Gang Chen and Junbo Zhao},
  journal= {arXiv preprint arXiv:2304.05265},
  year   = {2023}
}

备注

10 pages, 6 figures, 2 tables. Project Page: https://github.com/jnzju/COTI