MIRO:多奖励条件预训练提升文本到图像生成质量与效率
计算机视觉与模式识别
2026-05-20 v2 机器学习
摘要
默认的文本到图像生成器训练范式包括后期对生成图像进行筛选,并用单一奖励模型(通常为用户偏好)进行后续训练,这会丢弃有价值的信息,且仅优化单一奖励,损害多样性、语义忠实度和训练效率。相反,我们提出 MIRO 方法,通过在训练期间对模型施加多奖励条件,使模型能直接学习用户偏好。MIRO 预训练既提升了生成图像的视觉质量,又加速了训练,在 GenEval 组合基准测试和用户偏好得分(PickAScore、ImageReward、HPSv2)方面实现了最先进水平。
引用
@article{arxiv.2510.25897,
title = {MIRO: MultI-Reward cOnditioned pretraining improves T2I quality and efficiency},
author = {Nicolas Dufour and Lucas Degeorge and Arijit Ghosh and Vicky Kalogeiton and David Picard},
journal= {arXiv preprint arXiv:2510.25897},
year = {2026}
}
备注
Accepted at ICML 2026. Project page: https://nicolas-dufour.github.io/miro