中文

STORM-BORN:通过人在回路多智能体框架构建的挑战性数学推导数据集

计算与语言 2025-06-04 v2

摘要

高质量的数学数据集对于提升大型语言模型(LLM)的推理能力至关重要。然而,现有数据集通常存在三个关键问题:内容陈旧且挑战性不足、忽视类人推理,以及由于单一LLM生成导致可靠性有限。为解决这些问题,我们引入了STORM-BORN,这是一个源自前沿学术论文的超高难度数学推导数据集,其中包含密集的类人近似和启发式线索。为确保可靠性和质量,我们提出了一种新颖的人在回路多智能体数据生成框架,集成了推理密集型过滤器、多智能体协作以及人类数学家的评估。我们构建了一组2,000个合成样本,并刻意挑选了100个最困难的问题。即使是最先进的模型(如GPT-o1)也仅能解答其中不到5%的问题。在STORM-BORN上进行微调可使准确率提升7.84%(LLaMA3-8B)和9.12%(Qwen2.5-7B)。随着AI逼近数学家级别的推理水平,STORM-BORN既提供了高难度基准,也提供了类人推理训练资源。我们的代码和数据集已在 https://github.com/lwhere/STORM-BORN 公开。

关键词

引用

@article{arxiv.2506.01531,
  title  = {STORM-BORN: A Challenging Mathematical Derivations Dataset Curated via a Human-in-the-Loop Multi-Agent Framework},
  author = {Wenhao Liu and Zhenyi Lu and Xinyu Hu and Jierui Zhang and Dailin Li and Jiacheng Cen and Huilin Cao and Haiteng Wang and Yuhan Li and Kun Xie and Dandan Li and Pei Zhang and Chengbo Zhang and Yuxiang Ren and Xiaohong Huang and Yan Ma},
  journal= {arXiv preprint arXiv:2506.01531},
  year   = {2025}
}

备注

accepted by ACL2025