中文

Face0:在采样时瞬时以人脸为条件约束文本到图像模型

计算机视觉与模式识别 2023-06-13 v1 人工智能 图形学 机器学习

摘要

我们提出 Face0,一种在采样时瞬时以人脸为条件约束文本到图像生成模型的新方法,无需任何如微调或反演之类的优化过程。我们用所包含人脸的嵌入增强带标注图像的数据集,并在增强后的数据集上训练图像生成模型。一旦训练完成,我们的系统在推理时与底层基础模型几乎一致,因此能够在给定用户提供的脸图与提示词时,仅用几秒便生成图像。我们的方法取得了令人满意的结果,极其简单、极快,并为底层模型赋予了新能力,例如既可通过文本也可通过直接操控输入人脸嵌入来控制生成图像。此外,当使用固定随机向量代替用户供给图像的人脸嵌入时,我们的方法本质上解决了跨图像一致角色生成的问题。最后,尽管尚需进一步研究,我们希望这种将模型文本偏置与人脸偏置解耦的方法,能成为未来文本到图像模型中某种偏见缓解的一步。

关键词

引用

@article{arxiv.2306.06638,
  title  = {Face0: Instantaneously Conditioning a Text-to-Image Model on a Face},
  author = {Dani Valevski and Danny Wasserman and Yossi Matias and Yaniv Leviathan},
  journal= {arXiv preprint arXiv:2306.06638},
  year   = {2023}
}