中文

UniRL-Zero:基于统一模型的强化学习框架集语言模型与扩散模型专家

机器学习 2025-10-22 v1 人工智能

摘要

我们提出了 UniRL-Zero,一个统一的强化学习(RL)框架,用于提升多模态语言模型的理解与推理能力、扩散模型的多媒体生成能力,以及二者在统一模型内的相互作用能力。本工作定义了六种统一模型强化学习场景,为统一理解与生成模型的强化学习提供了系统性的基准。我们的代码已公开于 https://github.com/G-U-N/UniRL。

关键词

引用

@article{arxiv.2510.17937,
  title  = {UniRL-Zero: Reinforcement Learning on Unified Models with Joint Language Model and Diffusion Model Experts},
  author = {Fu-Yun Wang and Han Zhang and Michael Gharbi and Hongsheng Li and Taesung Park},
  journal= {arXiv preprint arXiv:2510.17937},
  year   = {2025}
}