中文

Text-to-Sticker:面向人类表达的风格定制潜在扩散模型

计算机视觉与模式识别 2024-10-04 v2

摘要

我们提出Style Tailoring,一种在具有高质量视觉、提示对齐和场景多样性的特定领域中微调潜在扩散模型(LDMs)的方法。我们选择贴纸图像生成作为目标领域,因为此类图像与大规模LDMs典型生成的照片级真实样本差异显著。我们从一个胜任的文本到图像模型(如Emu)出发,并指出依赖照片级真实模型的提示工程生成贴纸会导致较差的提示对齐与场景多样性。为克服这些缺陷,我们首先在利用弱监督收集的百万级类贴纸图像上微调Emu以激发多样性。接着,我们从模型生成中筛选人机协同(HITL)对齐与风格数据集,并分别微调以提升提示对齐与风格对齐。在这些数据集上的顺序微调带来了更好风格对齐与提示对齐增益之间的权衡。为解决该权衡,我们提出一种称为Style Tailoring的新颖微调方法,其联合拟合内容与风格分布并达成最佳权衡。评估结果显示,相较于用基础Emu模型提示工程生成贴纸,我们的方法将视觉质量提升14%、提示对齐提升16.2%、场景多样性提升15.3%。

关键词

引用

@article{arxiv.2311.10794,
  title  = {Text-to-Sticker: Style Tailoring Latent Diffusion Models for Human Expression},
  author = {Animesh Sinha and Bo Sun and Anmol Kalia and Arantxa Casanova and Elliot Blanchard and David Yan and Winnie Zhang and Tony Nelli and Jiahui Chen and Hardik Shah and Licheng Yu and Mitesh Kumar Singh and Ankit Ramchandani and Maziar Sanjabi and Sonal Gupta and Amy Bearman and Dhruv Mahajan},
  journal= {arXiv preprint arXiv:2311.10794},
  year   = {2024}
}

备注

10 pages, 5 figures