审判审判官:人类对多 LLM 评估的人类验证
计算机与社会
2026-02-17 v1 人工智能
摘要
设计符合 K--12 科学标准的高质量教学材料需要大量时间和专业知识。本研究检视了人类专家在审阅 AI 生成的此类教材评估时关注的事项,旨在将其洞见转化为面向未来基于生成式 AI 的教学材料设计智能体的设计原则。我们有意选取了来自 OpenSciEd 和 Multiple Literacies 项目等经验证的 12 个高质量课程单元(涵盖生命科学、物理科学和地球科学),使用 EQuIP 评估量表中的 9 项评估项目,引导 GPT-4o、Claude 和 Gemini 为每个单元生成数值评分和书面理由,产生 648 项评估输出。两位科学教育专家独立审阅所有输出,分别为分数和理由标记是否达成一致(1 或 0),并提供定性反思。该过程暴露了 LLM 判断与专家观点一致或不一致的模式,揭示了推理的优势、缺口以及情境细微差别。这些发现将直接信息用于开发面向 K--12 科学教育领域的特定生成式 AI 智能体,以支持高质量教学材料的设计。
引用
@article{arxiv.2602.13243,
title = {Judging the Judges: Human Validation of Multi-LLM Evaluation for High-Quality K--12 Science Instructional Materials},
author = {Peng He and Zhaohui Li and Zeyuan Wang and Jinjun Xiong and Tingting Li},
journal= {arXiv preprint arXiv:2602.13243},
year = {2026}
}