中文

FRAP: 基于自适应提示加权的忠实且逼真的文本到图像生成

计算机视觉与模式识别 2025-04-08 v2

摘要

文本到图像(T2I)扩散模型在根据文本提示生成高质量图像方面展现了令人印象深刻的能力。然而,确保提示-图像对齐仍然是一个相当大的挑战,即生成忠实于提示语义的图像。最近的工作试图通过优化潜在代码来提高忠实度,但这可能导致潜在代码偏离分布,从而产生不逼真的图像。在本文中,我们提出了FRAP,一种简单而有效的方法,基于自适应调整每个标记的提示权重来提高生成图像的提示-图像对齐度和真实性。我们设计了一种在线算法来自适应地更新每个标记的权重系数,这是通过最小化一个统一的损失函数来实现的,该损失函数鼓励对象存在以及对象-修饰符对的绑定。通过广泛的评估,我们表明FRAP生成的图像与复杂数据集的提示具有显著更高的提示-图像对齐度,同时与最近的潜在代码优化方法相比具有更低的平均延迟,例如在COCO-Subject数据集上比D&B快4秒。此外,通过视觉比较和CLIP-IQA-Real指标的评估,我们表明FRAP不仅提高了提示-图像对齐度,而且生成了具有逼真外观的更真实的图像。我们还探索了将FRAP与提示重写LLM相结合,以恢复其退化的提示-图像对齐度,我们观察到提示-图像对齐度和图像质量都有所改善。我们在以下链接发布代码:https://github.com/LiyaoJiang1998/FRAP/。

关键词

引用

@article{arxiv.2408.11706,
  title  = {FRAP: Faithful and Realistic Text-to-Image Generation with Adaptive Prompt Weighting},
  author = {Liyao Jiang and Negar Hassanpour and Mohammad Salameh and Mohan Sai Singamsetti and Fengyu Sun and Wei Lu and Di Niu},
  journal= {arXiv preprint arXiv:2408.11706},
  year   = {2025}
}

备注

TMLR 2025