中文

词汇丢弃法:在LLM共同进化中实现课程多样性

计算与语言 2026-04-29 v2 人工智能

摘要

共同进化自我博弈,即一个语言模型生成问题而另一个解决问题,有望实现无需人类监督的自主课程学习。在实践中,提议者会迅速收敛到满足奖励函数的狭窄问题分布。这种多样性崩溃使得课程对求解者而言变得无信息量,导致共同进化循环停滞。我们引入了词汇丢弃法,这是一种在策略训练和课程生成期间应用于提议者输出logits的随机掩码,作为一种维持多样性的轻量级机制。该掩码是硬性的且非平稳的,可防止提议者锁定固定的令牌序列。通过R-Zero在数学推理任务上训练Qwen3-4B和Qwen3-8B,我们发现词汇丢弃法在整个训练过程中,在词汇、语义和功能指标上维持了提议者的多样性,并为求解者带来了平均+4.4个点的提升(在8B模型上),其中在竞赛级基准上的增益最大。我们的研究结果表明,显式的动作空间约束,类似于经典自我博弈中游戏规则所扮演的结构性角色,有助于在语言中维持富有成效的共同进化。词汇丢弃法是这一原理的一个简单实例。

关键词

引用

@article{arxiv.2604.03472,
  title  = {Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution},
  author = {Jacob Dineen and Aswin RRV and Zhikun Xu and Ben Zhou},
  journal= {arXiv preprint arXiv:2604.03472},
  year   = {2026}
}