现代化真实标记:提高AI在教育领域可靠性与有效性的四大转变
计算机与社会
2026-04-01 v1
摘要
生成式人工智能(GenAI)在教育领域广泛应用,但GenAI系统的效能仍受限于用于训练和评估的标记数据质量与解释。常见报告的项目间可靠性(IRR),常以单一系数如Cohen's kappa(k)作为“真实标记”的门户。我们认为,许多教育评估和实践支持情境包含挑战,如高推理构建、标记分布不平衡以及时序分段的多模态数据,这些因素可能导致对基于阈值的IRR heuristics的误用或误解释。大型语言模型作为标注员和评判员的日益增长使用引入了自动化偏见和循环验证的风险。我们提出四项实用转变以建立真实标记:(1)将IRR视为定位不一致和细化构建的诊断信号,而非机械接受阈值(例如k > 0.8);(2)要求透明报告评审员专长、题典开发、调和程序和分段规则;(3)通过偏差审计和验证工作流程来缓解LLM标注中的风险;(4)补充接受统计量,加入针对预期用途的有效性和效果证据,包括不确定性感知标注(例如,为同一项目分配不同标记以捕捉细微差别)、准则相关性检查(例如,预测性测试以检查标记是否预测预期结果)以及闭环评估标注是否提高学习效果。我们通过多模态辅导数据案例研究说明了这些转变,并提供了 actionable 建议以加强AIED数据集标记证据基础。
引用
@article{arxiv.2603.29141,
title = {Modernizing Ground Truth: Four Shifts Toward Improving Reliability and Validity in AI in Education},
author = {Danielle R. Thomas and Conrad Borchers and Kirk P. Vanacore and Kenneth R. Koedinger and René F. Kizilcec},
journal= {arXiv preprint arXiv:2603.29141},
year = {2026}
}
备注
Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)