中文

通过预训练文本上基于量规的自对弈为开放式任务引导后训练信号

计算与语言 2026-05-08 v2 机器学习

摘要

自对弈最近已成为大型语言模型(LLM)后训练的一种有前景的范式。在自对弈中,目标 LLM 创建任务输入(例如,一个问题),然后通过生成任务输出(例如,一个答案)自行解决该任务。奖励模型评估输出,奖励通常通过强化学习(RL)用于训练 LLM。自对弈用于 LLM 后训练的一个关键优势是其极低的监督成本:自对弈避免了传统上由人类或昂贵的专有模型构建高质量输入-输出对的需求。然而,现有工作仅在可验证任务(如数学和编程)上探索自对弈,这些任务具有客观的真实答案且易于检查。在本文中,我们试图将自对弈扩展到更现实的开放式任务。我们提出了 POP,一个自对弈框架,它使用同一个 LLM 为每个输入-输出对合成评估量规。该量规用于评估输出并训练模型。至关重要的是,我们将该框架建立在内容丰富的预训练语料库之上,以(1)实现可利用的生成-验证差距并减少奖励黑客行为,以及(2)防止模式坍塌。在 Qwen-2.5-7B 上,POP 提升了预训练基座模型和指令微调模型在多项任务上的性能,这些任务涵盖从长篇医疗问答到创意写作和指令遵循。

关键词

引用

@article{arxiv.2604.20051,
  title  = {Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text},
  author = {Chengyu Huang and Sheng-Yen Chou and Zhengxin Zhang and Claire Cardie},
  journal= {arXiv preprint arXiv:2604.20051},
  year   = {2026}
}