从扩散反馈中强化学习:用于图像搜索的 Q*
计算机视觉与模式识别
2023-11-28 v1 人工智能
计算与语言
机器学习
机器人学
摘要
大型视觉-语言模型正稳步获得个性化能力,代价是微调或数据增强。我们提出两种使用模型无关学习的图像生成模型,将语义先验与生成能力对齐。RLDF,即从扩散反馈中强化学习(Reinforcement Learning from Diffusion Feedback),是一种通过保持先验的奖励函数引导实现视觉模仿的单一方法。其采用 Q-learning(标准 Q*)进行生成,并遵循语义奖励轨迹,通过有限编码定制的动作进行图像搜索。第二种提出的方法,噪声扩散梯度,是优化驱动的。两种方法的核心是我们为持续语义引导提出的特殊 CFG 编码。仅使用单张输入图像且无需文本输入,RLDF 在零售、体育和农业等多个领域生成高质量图像,展现出类别一致性与强视觉多样性。项目网站见 https://infernolia.github.io/RLDF。
引用
@article{arxiv.2311.15648,
title = {Reinforcement Learning from Diffusion Feedback: Q* for Image Search},
author = {Aboli Marathe},
journal= {arXiv preprint arXiv:2311.15648},
year = {2023}
}