中文

面向异构语言模型的互惠强化学习中的经验共享

机器学习 2026-05-11 v1 人工智能 计算与语言

摘要

我们提出了互惠强化学习框架,一种在保持独立参数、目标和分词器的前提下进行异构 LLM 策略之间交换类型经验的并行 RL 后训练方法。该框架结合了共享经验交换(SEE)、多工作者资源分配(MWRA)以及一个标记异构性层(THL),该层对文本进行重新分词并跨越不兼容词汇表对 token 级别的轨迹进行对齐。此底层设施使经验共享设计问题在模型家族之间可操作。我们在 GRPO 上实现了三个受控探针:通过同行 rollout 汇聚(PRP)实现数据层面的 rollout 共享,通过跨策略 GRPO 优势共享(XGRPO)实现价值层面的优势共享,通过成功门控迁移(SGT)实现结果层面的成功传递。情境式多臂老虎机分析刻画了它们在稳定性-支持权衡中的结构位置:PRP 支付密度比率方差和 THL 残差成本,XGRPO 保持准政策支持的同时改变标量基准,SGT 提供一条指向经验证的同行成功的救援集分数方向。在评估的范围内,结果层面的共享占据了该权衡的有利点。

关键词

引用

@article{arxiv.2605.07244,
  title  = {Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models},
  author = {Xiaoze Liu and Dhananjay Ram and Yuting Zhang and Zhaoyang Zhang and Wei Xia and Stefano Soatto},
  journal= {arXiv preprint arXiv:2605.07244},
  year   = {2026}
}

备注

50 pages, 10 figures, 14 tables