中文

SciDA:面向大语言模型的数值推理动态评估器

计算与语言 2025-06-17 v1

摘要

大型语言模型(LLM)推理能力的提升使其能够以更高效的方式解决科学问题。因此,高质量的综合性和恰当评估基准显得尤为重要,而现有基准要么面临数据污染风险,要么缺乏相关学科。具体而言,由于LLMs训练数据源与静态基准存在重叠,答案的关键词或数字模式不慎被记忆(即数据污染),导致对其推理能力进行系统性高估,尤其是数值推理。我们提出SciDA,一个多学科基准,包含超过1000个奥林匹克级数值计算问题,允许在每次推理轮中进行随机数值初始化,以避免依赖固定数值模式。我们使用闭源和开源的顶尖LLMs进行一系列实验,发现随机数值初始化下LLMs的性能显著下降。因此,我们提供了对LLMs数值推理能力的真实且无偏的评估。数据可在https://huggingface.co/datasets/m-a-p/SciDA获取。

关键词

引用

@article{arxiv.2506.12909,
  title  = {SciDA: Scientific Dynamic Assessor of LLMs},
  author = {Junting Zhou and Tingjia Miao and Yiyan Liao and Qichao Wang and Zhoufutu Wen and Yanqin Wang and Yunjie Huang and Ge Yan and Leqi Wang and Yucheng Xia and Hongwan Gao and Yuansong Zeng and Renjie Zheng and Chen Dun and Yitao Liang and Tong Yang and Wenhao Huang and Ge Zhang},
  journal= {arXiv preprint arXiv:2506.12909},
  year   = {2025}
}