中文

CoDiQ:可控困难问题生成的测试时扩展

计算与语言 2026-02-03 v1 人工智能

摘要

大型推理模型(LRM)从训练具有挑战性的竞赛级问题方面获益显著。然而,现有自动化问题合成方法缺乏精准难度控制、计算成本高、难以大规模生成竞赛级问题。本文提出 CoDiQ(Controllable Difficult Question Generation),一个通过测试时扩展实现精细难度控制且确保问题可解的框架。具体而言,我们识别出测试时扩展趋势(扩大的推理 token 预算提升难度但降低可解性)以及模型生成高难度问题能力上限的内在属性。随后,我们开发 CoDiQ-Generator 基于 Qwen3-8B,提升困难问题生成的上限,特别适合挑战性问题构建。基于 CoDiQ 框架,我们构建了 CoDiQ-Corpus(44K 组竞赛级问题序列)。人类评估显示,这些问题相较于 LiveCodeBench/AIME 更具挑战性,可解性超过 82%。在 CoDiQ-Corpus 上训练 LRM 可显著提升推理性能,证明受控难度训练问题的规模化对推理能力的提升。我们开源 CoDiQ-Corpus、CoDiQ-Generator 及相关实现,以支持后续研究。

关键词

引用

@article{arxiv.2602.01660,
  title  = {CoDiQ: Test-Time Scaling for Controllable Difficult Question Generation},
  author = {Zhongyuan Peng and Caijun Xu and Changyi Xiao and Shibo Hong and Eli Zhang and Stephen Huang and Yixin Cao},
  journal= {arXiv preprint arXiv:2602.01660},
  year   = {2026}
}

备注

11 pages, 5 tables, 5 figures