中文

DéjàQ:多样化、可学习且可验证问题的开放性进化

机器学习 2026-01-06 v1 人工智能

摘要

近期推进的推理模型在数学和编码方面取得了令人印象深刻的结果。然而,大多数方法依赖静态数据集,这被认为会鼓励记忆并限制泛化。我们引入DéjàQ,一个超越这一范式的框架,通过同步演化一套多样化的合成数学问题以及模型训练来实现这一点。这种演化过程会随模型能力的提升而自适应,优化问题以提高可学习性。我们提出了两种LLM驱动的突变策略,即模型本身通过改变情境细节或直接修改问题结构来变异训练数据。我们发现,模型能够生成新颖且有意义的问题,LLM驱动的突变可提高RL训练。我们分析了DéjàQ的关键方面,包括生成问题的有效性以及计算开销。我们的结果凸显了动态演化训练数据以增强数学推理潜力的可能性,并表明其更广泛的适用性,我们将通过开源代码予以支持。

关键词

引用

@article{arxiv.2601.01931,
  title  = {D\'ej\`aQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems},
  author = {Willem Röpke and Samuel Coward and Andrei Lupu and Thomas Foster and Tim Rocktäschel and Jakob Foerster},
  journal= {arXiv preprint arXiv:2601.01931},
  year   = {2026}
}