大规模自动化MCQA基准测试:评估推理轨迹作为小语言模型领域适应的检索源
计算与语言
2025-09-16 v1 人工智能
摘要
随着科学知识以前所未有的速度增长,评估基准必须不断演进以反映新的发现,并确保语言模型在最新、多样化的文献上进行测试。我们提出了一个可扩展的模块化框架,用于直接从大型科学论文语料库生成多项选择题问答(MCQA)基准。我们的流程自动化了MCQA创建的每个阶段,包括PDF解析、语义分块、问题生成和模型评估。作为案例研究,我们从22,000篇放射与癌症生物学的开放获取文章中生成了超过16,000道多项选择题。然后,我们评估了一系列小型语言模型(1.1B-14B参数)在这些问题上的表现,比较了基线准确率与基于论文语义块和从GPT-4.1蒸馏出的推理轨迹的检索增强生成(RAG)的准确率。我们发现,推理轨迹检索在合成基准和专家标注基准上均持续提升了性能,使多个小型模型在2023年Astro放射与癌症生物学考试中超越了GPT-4。
引用
@article{arxiv.2509.10744,
title = {Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models},
author = {Ozan Gokdemir and Neil Getty and Robert Underwood and Sandeep Madireddy and Franck Cappello and Arvind Ramanathan and Ian T. Foster and Rick L. Stevens},
journal= {arXiv preprint arXiv:2509.10744},
year = {2025}
}
备注
This manuscript has been accepted for publication at the Supercomputing 25 (SC '25) Conference (Frontiers in Generative AI for HPC Science and Engineering: Foundations, Challenges, and Opportunities Workshop) in St. Louis, MO, USA on November 16th, 2025. It will appear in the SC25 Workshop Proceedings after that date