中文

MasterWeaver:面向个性化文本到图像生成的编辑性与面部身份平衡

计算机视觉与模式识别 2024-07-30 v3

摘要

文本到图像(T2I)扩散模型在个性化文本到图像生成方面取得了显著成功,该任务旨在生成由参考图像指示的人类身份的新颖图像。尽管几种免微调方法实现了令人满意的身份保真度,但它们通常面临过拟合问题。学习到的身份倾向于与无关信息纠缠,导致文本可控性较差,尤其是在面部上。在本工作中,我们提出了MasterWeaver,一种测试时免微调方法,旨在生成兼具忠实身份保真度和灵活编辑性的个性化图像。具体而言,MasterWeaver采用编码器提取身份特征,并通过额外引入的交叉注意力来引导图像生成。为了在保持身份保真度的同时提高编辑性,我们提出了一种用于训练的编辑方向损失,使MasterWeaver的编辑方向与原始T2I模型的编辑方向对齐。此外,我们构建了一个面部增强数据集,以促进解耦的身份学习,并进一步提高编辑性。大量实验表明,我们的MasterWeaver不仅能生成具有忠实身份的个性化图像,而且在文本可控性方面也表现出优越性。我们的代码可在 https://github.com/csyxwei/MasterWeaver 找到。

关键词

引用

@article{arxiv.2405.05806,
  title  = {MasterWeaver: Taming Editability and Face Identity for Personalized Text-to-Image Generation},
  author = {Yuxiang Wei and Zhilong Ji and Jinfeng Bai and Hongzhi Zhang and Lei Zhang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2405.05806},
  year   = {2024}
}

备注

ECCV 2024. Our code can be found at https://github.com/csyxwei/MasterWeaver