中文

从扩散反馈中强化学习:用于图像搜索的 Q*

计算机视觉与模式识别 2023-11-28 v1 人工智能 计算与语言 机器学习 机器人学

摘要

大型视觉-语言模型正稳步获得个性化能力,代价是微调或数据增强。我们提出两种使用模型无关学习的图像生成模型,将语义先验与生成能力对齐。RLDF,即从扩散反馈中强化学习(Reinforcement Learning from Diffusion Feedback),是一种通过保持先验的奖励函数引导实现视觉模仿的单一方法。其采用 Q-learning(标准 Q*)进行生成,并遵循语义奖励轨迹,通过有限编码定制的动作进行图像搜索。第二种提出的方法,噪声扩散梯度,是优化驱动的。两种方法的核心是我们为持续语义引导提出的特殊 CFG 编码。仅使用单张输入图像且无需文本输入,RLDF 在零售、体育和农业等多个领域生成高质量图像,展现出类别一致性与强视觉多样性。项目网站见 https://infernolia.github.io/RLDF。

关键词

引用

@article{arxiv.2311.15648,
  title  = {Reinforcement Learning from Diffusion Feedback: Q* for Image Search},
  author = {Aboli Marathe},
  journal= {arXiv preprint arXiv:2311.15648},
  year   = {2023}
}