中文

面向中学数学的LLM异构模型人类在回环式基准测试:自动化 competency 评估

人工智能 2026-04-30 v1 计算机与社会 软件工程

摘要

随着基于能力的教育(CBE)在全球范围内广泛采用,由分数驱动的评估向定性能力映射的转变正在面临教育者的手动挑战。本文通过建议一种“人类在回环式”基准测试框架来评估多模型在自动化中学数学评估中的效果。基于尼泊尔十年级可选数学课程,我们构建了一个多维度评分标准,用于四个主题和四个横向能力:理解、知识、操作流畅度与行为与关联。该多提供者集成包括开源权重模型——Eagle(Llama 3.1-8B)和 Orion(Llama 3.3-70B),以及专有前沿模型 Nova(Gemini 2.5 Flash)和 Lyra(Gemini 3 Pro),其效果以两位资深数学教师定义的基准(kappa_w = 0.8652)进行 benchmark。研究发现出现明显的“架构兼容性差距”。尽管基于 Gemini 的 Mixture-of-Experts(稀疏 MoE)模型实现了“公平一致”(kappa_w ~ 0.38),更大尺度的 Orion(70B)模型表现为“无一致”(kappa_w = -0.0261),表明在以评分标准为约束的任务中,架构对指令约束的兼容性优于原始参数规模。我们得出结论,尽管 LLMs 尚不适合用于自主认证,但它们在“人类在回环式”框架中为初步证据提取提供了高价值的辅助支持。

关键词

引用

@article{arxiv.2604.26607,
  title  = {Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics},
  author = {Jatin Bhusal and Nancy Mahatha and Aayush Acharya and Raunak Regmi},
  journal= {arXiv preprint arXiv:2604.26607},
  year   = {2026}
}

备注

5 pages, 3 figures, 5 tables. Submitted to 2AI-2026-Applied AI Conference