中文

ID-Aligner:基于奖励反馈学习增强身份保持文本到图像生成

计算机视觉与模式识别 2024-04-25 v1 人工智能

摘要

扩散模型的快速发展催生了多样化的应用。其中,身份保持文本到图像生成(ID-T2I)因其广泛的应用场景,如 AI 肖像和广告领域而受到高度关注。虽然现有的 ID-T2I 方法已取得令人印象深刻的结果,但仍面临若干关键挑战:(1)难以准确保持参考肖像的身份特征,(2)在强制保持身份的同时,生成的图像缺乏审美吸引力,(3)无法同时兼容基于 LoRA 和基于 Adapter 的方法。为此,我们提出了 \textbf{ID-Aligner},一个通用的反馈学习框架,用于增强 ID-T2I 性能。为解决身份特征丢失问题,我们引入身份一致性奖励微调,利用面部检测和识别模型的反馈来提高生成身份的保持。此外,我们提出身份审美奖励微调,利用来自人工标注的偏好数据和自动构建的角色结构生成反馈,以提供审美调谐信号。得益于其通用的反馈微调框架,ID-Aligner 可以轻松应用于 LoRA 和 Adapter 模型,实现持久的性能提升。在 SD1.5 和 SDXL 扩散模型上的大量实验验证了我们方法的有效性。\textbf{项目页面:\url{https://idaligner.github.io/}}

关键词

引用

@article{arxiv.2404.15449,
  title  = {ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning},
  author = {Weifeng Chen and Jiacheng Zhang and Jie Wu and Hefeng Wu and Xuefeng Xiao and Liang Lin},
  journal= {arXiv preprint arXiv:2404.15449},
  year   = {2024}
}