中文

RLLaVA:面向语言与视觉助手的 RL 中心框架

机器学习 2025-12-29 v1

摘要

我们提出一个面向语言与视觉助手的 RL 中心框架 (RLLaVA),并给出其马尔可夫决策过程 (MDP) 的表述。RLLaVA 将 RL 算法逻辑与模型架构及分布式执行解耦,支持研究者以最少代码实现新的 RL 算法,并能够插入广泛的 RL 方法与视觉语言模型 (VLM),而不受特定训练与推理引擎的限制。RLLaVA 使得对 1B--7B 参数模型实现资源高效训练可行;值得注意的是,4B 参数规模的模型可在单块 24GB 显存的 GPU 上进行端到端全参数更新。实验在多模态与智能体任务上表明,RLLaVA 具备任务可扩展性,训练而得模型在基线模型上 consistently 获得性能提升,与其他专门设计的 RL 框架保持竞争力。代码已发布于 https://github.com/TinyLoopX/RLLaVA。

关键词

引用

@article{arxiv.2512.21450,
  title  = {RLLaVA: An RL-central Framework for Language and Vision Assistants},
  author = {Lei Zhao and Zihao Ma and Boyu Lin and Yuhe Liu and Wenjun Wu and Lei Huang},
  journal= {arXiv preprint arXiv:2512.21450},
  year   = {2025}
}

备注

The code is available at https://github.com/TinyLoopX/RLLaVA