中文

AI 工具在分类数学任务认知需求方面的基准性能

计算机与社会 2026-03-06 v1 人工智能

摘要

教师面临日益增加的工作负担,尤其是在维持认知严谨性的同时为个体学生需求定制数学课程。本研究评估了 AI 工具是否能准确分类数学任务的认知需求,这对创建或调整支持学生学习的任务至关重要。我们测试了十一款 AI 工具:六款通用工具(ChatGPT、Claude、DeepSeek、Gemini、Grok、Perplexity)和五款教育专用工具(Brisk、Coteach AI、Khanmigo、Magic School、School..AI),其在运用研究方法对数学任务进行四级认知需求分类方面的能力。目标是模拟教师在简单提示下的表现。平均而言,AI 工具仅在 63% 的情况下准确分类了认知需求。教育专用工具的准确性不如于通用工具,且没有工具超过 83% 的准确率。所有工具在认知需求极端层级(记忆和做数学)方面都表现不佳,系统性偏向中间层级(带/无连接的程序)。这些工具常给出听起来合理的解释,可能令初学者教师信服。对 AI 工具误分类的分析揭示,工具们持续高估了表面文本特征,低估了底层认知过程。此外,AI 工具在判断任务是高还是低认知需求方面存在弱点。这些错误并非源于忽略相关维度,而是源于对多个任务方面的错误推理。这些发现对 AI 集成到教师规划工作流程具有意义,并凸显了针对教育应用改进提示工程和工具开发的必要性。

关键词

引用

@article{arxiv.2603.03512,
  title  = {Baseline Performance of AI Tools in Classifying Cognitive Demand of Mathematical Tasks},
  author = {Danielle S. Fox and Brenda L. Robles and Elizabeth DiPietro Brovey and Christian D. Schunn},
  journal= {arXiv preprint arXiv:2603.03512},
  year   = {2026}
}

备注

30 pages, 2 tables, 5 appendices