数学任务评估中的时间稳定性与少样本提示
人工智能
2026-05-29 v1
摘要
随着AI工具日益集成到教育情境中,关于其随时间变化的稳定性以及对提示工程技术的响应性问题日益引人关注。本纵向研究聚焦于不同AI工具在使用任务分析指南 (TAG; Stein & Smith, 1998) 对数学任务认知需求进行分类的能力。在 particular, 它检验了这种分类能力是否随 (1) 模型版本随时间的更新以及 (2) 使用示例任务的少样本提示而发生变化。我们测试了通用AI工具 (Gemini) 和教育专用AI工具 (Coteach)。所选工具是由于其在相关已发布基准和先前任务特定测试上的相对较高性能。模型在基线测试后,分别进行模型版本更新的重测以及使用少样本提示的测试 (每个认知需求类别各使用两个示例任务)。结果显示,较新模型版本本身仅产生混合效果:Gemini的准确率保持稳定在58%,而Coteach的准确率下降从75%降至50%。然而,少样本提示提升了两个模型的性能:Gemini提高到67%,Coteach恢复到75%准确率。这些发现表明,提示工程技术的效果可能大于被动的模型改进,并且版本更新可能并不总是改善针对特定教育任务的性能。该研究对教育者和研究人员如何在教育情境中选择、评估和实施AI工具具有重要启示。
引用
@article{arxiv.2605.30151,
title = {Temporal Stability and Few-Shot Prompting in Math Task Assessment},
author = {Danielle S. Fox and Brenda L. Robles and Elizabeth DiPietro Brovey and Christian D. Schunn},
journal= {arXiv preprint arXiv:2605.30151},
year = {2026}
}
备注
23 pages, 1 figure