基于奖励的噪声优化提升一步文本到图像模型
计算机视觉与模式识别
2024-11-01 v2
摘要
文本到图像 (T2I) 模型在近年来取得了显著进展,但仍难以准确捕捉复杂构面提示中细节。虽然使用奖励目标进行微调 T2I 模型显示出前景,但存在“奖励入侵”且可能难以适应未见提示分布。本文提出奖励驱动的噪声优化 (ReNO),一种新方法,通过优化初始噪声来提升推理时的 T2I 模型性能,基于一个或多个人类偏好奖励模型的信号。令人惊讶的是,使用梯度上升进行 50 次迭代即可在四个不同一步模型上取得显著成果,这些模型在两个竞争性基准测试中表现良好,分别为 T2I-CompBench 和 GenEval。在 20-50 秒的计算预算内,ReNO 提升后的一步模型始终超过所有当前开源文本到图像模型的性能。广泛的用户研究表明,我们的模型在偏好测试中几乎总能以近一倍的频率优于流行的 SDXL 模型,并与拥有 80 亿参数的专有 Stable Diffusion 3 持平。此外,在相同的计算资源下,ReNO 优化后的一步模型 outperform 广泛使用的开源模型如 SDXL 和 PixArt-,凸显了 ReNO 在推理时提升 T2I 模型性能方面的效率和效果。代码可在 https://github.com/ExplainableML/ReNO 获取。
引用
@article{arxiv.2406.04312,
title = {ReNO: Enhancing One-step Text-to-Image Models through Reward-based Noise Optimization},
author = {Luca Eyring and Shyamgopal Karthik and Karsten Roth and Alexey Dosovitskiy and Zeynep Akata},
journal= {arXiv preprint arXiv:2406.04312},
year = {2024}
}
备注
NeurIPS 2024