中文

ResearchMath-14K:通过智能体实现科研级数学规模化

计算与语言 2026-05-28 v1

摘要

数学研究的前沿由尚未知晓解答的问题所定义,但语言模型能否在无需人工干预的情况下真正参与其中仍不明朗。这一重要障碍是缺乏大规模科研级数学数据集。为此,我们引入 ResearchMath-14k,这是一套 14,05614{,}056 题经由多智能体管道精选的科研级数学问题,是迄今为止最大规模的此类问题集合。我们进一步生成 ResearchMath-Reasoning,包含 220220K 条两款开源模型的教师轨迹,观察到包括不尝试与虚构参考等反复规避行为。有趣的是,在八款开源权重模型中,更新后的模型在每条轨迹中产生的参考文献数为原来的 5.65.6 倍,虚构参考文献数为原来的 5.05.0 倍。经智能体过滤后的 ResearchMath-Reasoning 用于微调 Qwen3 模型(参数从 4B 扩展至 30B),在基准模型上平均提升 9.29.2 分。这表明即便没有完整正确的推理轨迹,经过滤后的开放性问题尝试仍可提供有用的监督信号。我们将使 ResearchMath-14k 公开,以便未来工作使用。

关键词

引用

@article{arxiv.2605.28003,
  title  = {ResearchMath-14K: Scaling Research-Level Mathematics via Agents},
  author = {Guijin Son and Seungyeop Yi and Minju Gwak and Hyunwoo Ko and Wongi Jang and Youngjae Yu},
  journal= {arXiv preprint arXiv:2605.28003},
  year   = {2026}
}

备注

Work in progress. Dataset available at: https://huggingface.co/datasets/amphora/ResearchMath-14k