AI 工具能否转化低需求数学任务?任务修改能力的评估
人工智能
2026-04-15 v1
摘要
虽然近期的研究探索了 AI 工具对数学任务质量分类的能力(arXiv:2603.03512),但关于其提升现有任务质量的能力仍鲜有了解。本研究考察了 AI 工具是否能成功升级低认知需求的数学任务。测试了 11 个工具,包括六个广泛可用的通用 AI 工具(如 ChatGPT 和 Claude)和五个专为数学教师设计的工具(如 Khanmigo、coteach.ai)。使用任务分析指南框架(Stein & Smith, 1998),我们让 AI 工具修改两种不同类型的低需求数学任务。提示策略旨在代表知识丰富教师可能的做法,而非针对寻找更有效提示进行广泛优化(即乐观的典型结果)。平均而言,AI 工具仅 moderately 成功:任务准确升级的比例为 64%,不同 AI 工具的性能范围从较弱(33%)到相当成功(88%)。专用工具仅 moderately 优于通用工具。失败模式包括“不足”(维持低认知需求)和“过度”(将任务提升至过于 ambitious 的目标类别,可能被教师拒绝)。有趣的是,AI 工具能否正确分类任务认知需求与能否升级任务之间存在较小的负相关(r = -.35),表明修改任务(即生成式任务)的能力代表了与使用评级标准进行判断(即评估任务)的不同能力。这一发现对理解 AI 在课程调整中的潜在作用具有重要意义,并突显了支持教师修改教学材料的需要。
引用
@article{arxiv.2604.12743,
title = {Can AI Tools Transform Low-Demand Math Tasks? An Evaluation of Task Modification Capabilities},
author = {Danielle S. Fox and Brenda L. Robles and Elizabeth DiPietro Brovey and Christian D. Schunn},
journal= {arXiv preprint arXiv:2604.12743},
year = {2026}
}
备注
21 pages, 1 figure