中文

审判审判官:人类对多 LLM 评估的人类验证

计算机与社会 2026-02-17 v1 人工智能

摘要

设计符合 K--12 科学标准的高质量教学材料需要大量时间和专业知识。本研究检视了人类专家在审阅 AI 生成的此类教材评估时关注的事项,旨在将其洞见转化为面向未来基于生成式 AI 的教学材料设计智能体的设计原则。我们有意选取了来自 OpenSciEd 和 Multiple Literacies 项目等经验证的 12 个高质量课程单元(涵盖生命科学、物理科学和地球科学),使用 EQuIP 评估量表中的 9 项评估项目,引导 GPT-4o、Claude 和 Gemini 为每个单元生成数值评分和书面理由,产生 648 项评估输出。两位科学教育专家独立审阅所有输出,分别为分数和理由标记是否达成一致(1 或 0),并提供定性反思。该过程暴露了 LLM 判断与专家观点一致或不一致的模式,揭示了推理的优势、缺口以及情境细微差别。这些发现将直接信息用于开发面向 K--12 科学教育领域的特定生成式 AI 智能体,以支持高质量教学材料的设计。

关键词

引用

@article{arxiv.2602.13243,
  title  = {Judging the Judges: Human Validation of Multi-LLM Evaluation for High-Quality K--12 Science Instructional Materials},
  author = {Peng He and Zhaohui Li and Zeyuan Wang and Jinjun Xiong and Tingting Li},
  journal= {arXiv preprint arXiv:2602.13243},
  year   = {2026}
}