教育中的 AI 评估重新思考:TEACH-AI 框架与基准测试
计算机与社会
2025-12-05 v1 人工智能
人机交互
机器学习
摘要
生成式人工智能(AI)持续变革教育,现有大多数 AI 评估主要依赖技术性能指标,如准确率或任务效率,而忽视了人类身份、学习主体性、情境学习过程以及伦理考量。本文提出了 TEACH-AI(Trustworthy and Effective AI Classroom Heuristics),一个领域独立、以教育学为基础、与利益相关者一致的框架,配有可衡量的指标和实用工具,用于指导教育情境下生成式 AI 系统的设计、开发和评估。基于广泛的文献综述与综合,TEACH-AI 提供了十组成分评估框架和工具清单,为可扩展的、价值导向的教育 AI 评估奠定基础。TEACH-AI 通过社会技术、教育、理论和应用视角重新定义“评估”,吸纳 AI 与教育领域的设计师、开发者、研究者和政策制定者。我们的工作邀请社区重新思考“什么构成有效的教育 AI”,并设计促进共创、包容性以及长期人类、社会和教育影响的模型评估方法。
引用
@article{arxiv.2512.04107,
title = {Rethinking AI Evaluation in Education: The TEACH-AI Framework and Benchmark for Generative AI Assistants},
author = {Shi Ding and Brian Magerko},
journal= {arXiv preprint arXiv:2512.04107},
year = {2025}
}
备注
6 pages, NeurIPS 2025 Responsible Foundation Models Workshop