中文

教育中的 AI 评估重新思考:TEACH-AI 框架与基准测试

计算机与社会 2025-12-05 v1 人工智能 人机交互 机器学习

摘要

生成式人工智能(AI)持续变革教育,现有大多数 AI 评估主要依赖技术性能指标,如准确率或任务效率,而忽视了人类身份、学习主体性、情境学习过程以及伦理考量。本文提出了 TEACH-AI(Trustworthy and Effective AI Classroom Heuristics),一个领域独立、以教育学为基础、与利益相关者一致的框架,配有可衡量的指标和实用工具,用于指导教育情境下生成式 AI 系统的设计、开发和评估。基于广泛的文献综述与综合,TEACH-AI 提供了十组成分评估框架和工具清单,为可扩展的、价值导向的教育 AI 评估奠定基础。TEACH-AI 通过社会技术、教育、理论和应用视角重新定义“评估”,吸纳 AI 与教育领域的设计师、开发者、研究者和政策制定者。我们的工作邀请社区重新思考“什么构成有效的教育 AI”,并设计促进共创、包容性以及长期人类、社会和教育影响的模型评估方法。

关键词

引用

@article{arxiv.2512.04107,
  title  = {Rethinking AI Evaluation in Education: The TEACH-AI Framework and Benchmark for Generative AI Assistants},
  author = {Shi Ding and Brian Magerko},
  journal= {arXiv preprint arXiv:2512.04107},
  year   = {2025}
}

备注

6 pages, NeurIPS 2025 Responsible Foundation Models Workshop