中文

针对未见随机变量问题的数学推理基准测试

计算与语言 2025-08-14 v4 人工智能

摘要

近期研究对当前数学基准测试的可靠性提出了大量担忧,指出其设计简陋且可能存在数据污染的问题。因此,开发一个可靠的基准测试以有效评估大语言模型(LLM)在数学推理方面的真实能力,仍然是一个关键挑战。为解决这些担忧,我们提出了 RV-Bench,这是一种用于评估 LLM 在数学推理中处理随机变量的评估方法。具体而言,我们构建问题生成函数,以产生随机变量问题(RVQs),其背景内容模仿原始基准问题,但随机化了变量组合,使其对 LLM 而言是“未见”的。模型必须完全理解问题模式的内在结构,才能正确回答包含多样变量组合的 RVQs。因此,LLM 在 RV-Bench 上的准确率和鲁棒性,能够反映其真正的推理能力。我们对超过 30 个代表性 LLM 进行了在超过 1000 题 RVQs 的大规模实验。我们的发现表明,LLM 在遇到与“未见”数据分布之间的技能表现存在不平衡。此外,RV-Bench 揭示了 LLM 在类似数学推理任务之间的技能泛化能力有限,但我们验证通过测试时扩展可以有效地激发这种能力。

关键词

引用

@article{arxiv.2501.11790,
  title  = {Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions},
  author = {Zijin Hong and Hao Wu and Su Dong and Junnan Dong and Yilin Xiao and Yujing Zhang and Zhu Wang and Feiran Huang and Linyi Li and Hongxia Yang and Xiao Huang},
  journal= {arXiv preprint arXiv:2501.11790},
  year   = {2025}
}