中文

DiffExp:文本到图像扩散模型奖励微调中的高效探索

计算机视觉与模式识别 2025-02-21 v1 人工智能

摘要

微调文本到图像扩散模型以最大化奖励已被证明能有效提升模型性能。然而,由于在线样本生成,奖励微调方法常常收敛缓慢。因此,获取具有强奖励信号的多样化样本对于提高样本效率和整体性能至关重要。在本工作中,我们引入了 DiffExp,一种简单而有效的文本到图像模型奖励微调探索策略。我们的方法采用两个关键策略:(a) 动态调整无分类器引导的尺度以增强样本多样性,(b) 随机加权文本提示的短语以利用高质量奖励信号。我们证明,这些策略显著增强了在线样本生成过程中的探索,提高了近期奖励微调方法(如 DDPO 和 AlignProp)的样本效率。

关键词

引用

@article{arxiv.2502.14070,
  title  = {DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models},
  author = {Daewon Chae and June Suk Choi and Jinkyu Kim and Kimin Lee},
  journal= {arXiv preprint arXiv:2502.14070},
  year   = {2025}
}

备注

AAAI 2025