中文

基于跨模型熵的无标签强化学习

机器学习 2026-05-29 v1 人工智能

摘要

通过强化学习对大型语言模型的后训练受奖励信号瓶颈限制。现有方法要么需要地面实验可验证的奖励,将训练限制在具有自动正确性检查的领域(如数学、代码执行),要么需要人类偏好标签,收集成本高且容易出现奖励攻击。最近的无标签方法用自指信号(如多数投票或模型自身输出的token熵)取代地面验证器,但风险在于强化模型自身的错误。在本工作中,我们提出了跨模型熵(Cross-Model Entropy, CME),即生成器响应在独立验证器模型下的平均对数似然率,用作RL后训练的无标签奖励信号。CME是连续的、无需训练的,且基于验证器发现的那些不令人惊讶的响应可能是正确或高质量的原则。由于验证器独立于生成器,该信号无法通过自洽性被操控。我们将CME集成到GRPO中,仅需对训练循环进行其他更改,将无标签RL扩展到开放式指令遵循——即自指信号在此 regimes 中不可应用或不太适合。在开放式指令遵循(UltraFeedback提示,在AlpacaEval 2.0上评估)中,CME奖励在四个模型家族(Qwen、Llama、Gemma、OLMo)和三个训练 regime(预训练、SFT、指令微调)中与未训练的基线进行头战比较,调整后赢得率范围为52.5%至71.4%。代码将在出版后发布。

关键词

引用

@article{arxiv.2605.29009,
  title  = {Label-Free Reinforcement Learning via Cross-Model Entropy},
  author = {Matt Gorbett and Hossein Shirazi},
  journal= {arXiv preprint arXiv:2605.29009},
  year   = {2026}
}