ResearchMath-14K:通过智能体实现科研级数学规模化
计算与语言
2026-05-28 v1
摘要
数学研究的前沿由尚未知晓解答的问题所定义,但语言模型能否在无需人工干预的情况下真正参与其中仍不明朗。这一重要障碍是缺乏大规模科研级数学数据集。为此,我们引入 ResearchMath-14k,这是一套 题经由多智能体管道精选的科研级数学问题,是迄今为止最大规模的此类问题集合。我们进一步生成 ResearchMath-Reasoning,包含 K 条两款开源模型的教师轨迹,观察到包括不尝试与虚构参考等反复规避行为。有趣的是,在八款开源权重模型中,更新后的模型在每条轨迹中产生的参考文献数为原来的 倍,虚构参考文献数为原来的 倍。经智能体过滤后的 ResearchMath-Reasoning 用于微调 Qwen3 模型(参数从 4B 扩展至 30B),在基准模型上平均提升 分。这表明即便没有完整正确的推理轨迹,经过滤后的开放性问题尝试仍可提供有用的监督信号。我们将使 ResearchMath-14k 公开,以便未来工作使用。
引用
@article{arxiv.2605.28003,
title = {ResearchMath-14K: Scaling Research-Level Mathematics via Agents},
author = {Guijin Son and Seungyeop Yi and Minju Gwak and Hyunwoo Ko and Wongi Jang and Youngjae Yu},
journal= {arXiv preprint arXiv:2605.28003},
year = {2026}
}
备注
Work in progress. Dataset available at: https://huggingface.co/datasets/amphora/ResearchMath-14k