中文

RLVR-World:基于强化学习训练世界模型

机器学习 2025-10-28 v2 人工智能

摘要

世界模型预测给定动作后的状态转换,在各种模态中不断发展。然而,诸如最大似然估计(MLE)等标准训练目标常与世界模型的 task-specific 目标不一致,即转换预测指标如准确率或感知质量。在本文中,我们提出了 RLVR-World,一个统一的框架,利用可验证奖励的强化学习(RLVR)直接优化世界模型以适应此类指标。尽管将世界建模表述为标记序列的自回归预测,RLVR-World 仍会对解码预测的指标进行可验证奖励评估。在语言和视频基于世界模型的性能方面,我们在 text games、web navigation 和 robot manipulation 等领域实现了显著的性能提升。我们的工作表明,除了最近在推理语言模型方面的进展之外,RLVR 为增强生成模型的实用性提供了一条有前景的 post-training 范式。代码、数据集、模型和视频样本均在项目网站上提供:https://thuml.github.io/RLVR-World。

关键词

引用

@article{arxiv.2505.13934,
  title  = {RLVR-World: Training World Models with Reinforcement Learning},
  author = {Jialong Wu and Shaofeng Yin and Ningya Feng and Mingsheng Long},
  journal= {arXiv preprint arXiv:2505.13934},
  year   = {2025}
}

备注

NeurIPS 2025. Code is available at project website: https://thuml.github.io/RLVR-World/