中文

将强化学习集成到视觉生成模型中:基础与进展

计算机视觉与模式识别 2026-01-21 v3

摘要

生成模型在合成图像、视频和 3D/4D 结构方面取得了显著进展。然而,它们通常以似然或重构损失等代理目标进行训练,这些目标常与感知质量、语义准确性或物理真实性不一致。强化学习(RL)提供了一种原则化的框架,用于优化非可微分、以偏好为导向且具有时序结构的目标。近期进展表明,其在增强生成任务的可控性、一致性和人类对齐方面效果显著。本综述系统概述了用于视觉内容生成的RL方法。我们回顾了RL从经典控制到通用优化工具的演变,并审查了其在图像、视频和 3D/4D 生成中的集成。在这些领域中,RL不仅作为微调机制,还作为与复杂高层目标对齐的结构组件。我们总结了RL与生成建模交叉领域的挑战和未来研究方向。

关键词

引用

@article{arxiv.2508.10316,
  title  = {Integrating Reinforcement Learning with Visual Generative Models: Foundations and Advances},
  author = {Yuanzhi Liang and Yijie Fang and Ke Hao and Rui Li and Ziqi Ni and Ruijie Su and Chi Zhang},
  journal= {arXiv preprint arXiv:2508.10316},
  year   = {2026}
}

备注

Ongoing work. We maintain a companion website with an up-to-date version of this survey at: https://visgenrlsurvey.liangyzh18.workers.dev/