PALP:面向文本到图像模型的提示词对齐个性化方法
计算机视觉与模式识别
2024-01-12 v1 计算与语言
图形学
机器学习
摘要
内容创作者通常希望使用超出传统文本到图像模型能力的个人主题来创建个性化图像。此外,他们可能希望生成的图像包含特定的地点、风格、氛围等。现有的个性化方法可能会损害个性化能力或与复杂文本提示的对齐度。这种权衡可能阻碍用户提示的满足和主题保真度。我们提出了一种专注于单一提示的个性化方法来解决这个问题。我们将我们的方法称为提示词对齐个性化。虽然这看似具有限制性,但我们的方法在改善文本对齐方面表现出色,能够创建具有复杂精细提示的图像,这可能对当前技术构成挑战。特别是,我们的方法通过使用额外的得分蒸馏采样项,使个性化模型与目标提示保持对齐。我们展示了该方法在多镜头和单镜头设置中的多功能性,并进一步表明它可以组合多个主题或从参考图像(如艺术品)中汲取灵感。我们将我们的方法与现有基线及最先进技术进行了定量和定性比较。
引用
@article{arxiv.2401.06105,
title = {PALP: Prompt Aligned Personalization of Text-to-Image Models},
author = {Moab Arar and Andrey Voynov and Amir Hertz and Omri Avrahami and Shlomi Fruchter and Yael Pritch and Daniel Cohen-Or and Ariel Shamir},
journal= {arXiv preprint arXiv:2401.06105},
year = {2024}
}
备注
Project page available at https://prompt-aligned.github.io/