中文

文本到图像扩散模型的极简微调方法

机器学习 2025-07-02 v3 人工智能

摘要

近期工作使用强化学习(RL)微调文本到图像扩散模型,改善文本-图像对齐和样本质量。然而,现有方法引入了不必要的复杂性:它们缓存完整的采样轨迹,依赖可微分奖励模型或大型偏好数据集,或需要专门的引导技术。受'黄金噪声'假说——即某些初始噪声样本可以持续产生更优的对齐——的启发,我们引入了 Noise PPO,一种极简的 RL 算法,完全冻结预训练的扩散模型并学习一个提示条件化的初始噪声生成器。我们的方法不需要轨迹存储、奖励反向传播或复杂的引导技巧。广泛的实验表明,优化初始噪声分布持续改善了对齐和样本质量,相比原始模型在低推理步骤时获得最大收益。随着推理步骤的增加,噪声优化的收益减小但仍然存在。这些发现阐明了黄金噪声假说的适用范围和局限性,并强化了极简 RL 微调扩散模型的实用价值。

关键词

引用

@article{arxiv.2506.12036,
  title  = {A Minimalist Method for Fine-tuning Text-to-Image Diffusion Models},
  author = {Yanting Miao and William Loh and Pacal Poupart and Suraj Kothawade},
  journal= {arXiv preprint arXiv:2506.12036},
  year   = {2025}
}

备注

17 pages, 6 figures