中文

基于奖励的噪声优化提升一步文本到图像模型

计算机视觉与模式识别 2024-11-01 v2

摘要

文本到图像 (T2I) 模型在近年来取得了显著进展,但仍难以准确捕捉复杂构面提示中细节。虽然使用奖励目标进行微调 T2I 模型显示出前景,但存在“奖励入侵”且可能难以适应未见提示分布。本文提出奖励驱动的噪声优化 (ReNO),一种新方法,通过优化初始噪声来提升推理时的 T2I 模型性能,基于一个或多个人类偏好奖励模型的信号。令人惊讶的是,使用梯度上升进行 50 次迭代即可在四个不同一步模型上取得显著成果,这些模型在两个竞争性基准测试中表现良好,分别为 T2I-CompBench 和 GenEval。在 20-50 秒的计算预算内,ReNO 提升后的一步模型始终超过所有当前开源文本到图像模型的性能。广泛的用户研究表明,我们的模型在偏好测试中几乎总能以近一倍的频率优于流行的 SDXL 模型,并与拥有 80 亿参数的专有 Stable Diffusion 3 持平。此外,在相同的计算资源下,ReNO 优化后的一步模型 outperform 广泛使用的开源模型如 SDXL 和 PixArt-α\alpha,凸显了 ReNO 在推理时提升 T2I 模型性能方面的效率和效果。代码可在 https://github.com/ExplainableML/ReNO 获取。

关键词

引用

@article{arxiv.2406.04312,
  title  = {ReNO: Enhancing One-step Text-to-Image Models through Reward-based Noise Optimization},
  author = {Luca Eyring and Shyamgopal Karthik and Karsten Roth and Alexey Dosovitskiy and Zeynep Akata},
  journal= {arXiv preprint arXiv:2406.04312},
  year   = {2024}
}

备注

NeurIPS 2024