中文

用于 LLM 教育的数学数字�影:模拟学生与 AI 的数学表现、焦虑与自信

人工智能 2026-05-01 v1 计算机与社会 人机交互 机器学习 社会与信息网络

摘要

为了提升大语言模型(LLM)在数学教育中的影响力,需获取其在不同提示下的数学能力与偏见数据。为填补这一空白,我们引入了 MEDS(Math Education Digital Shadows,即数学教育数字�影)数据集,映射大型语言模型在人类与 AI 类条件下进行数学推理与报告的方式。MEDS 包含来自 14 个大型语言模型(来自 Mistral、Qwen、DeepSeek、Granite、Phi 与 Grok 等模型家族)的 28,000 个人格,分别模拟人类或 AI 助理的行为。每条记录/�影包含一组提示、心理/社会人口统计人格元数据,以及四类数学任务:(i)开放数学访谈,(ii)关于数学认知的三项心理测量测试及解释,(iii)捕捉数学态度的认知网络,(iv)18 题高中数学测试题目及其推理过程与自信程度评分。MEDS 不同于传统仅关注得分的数学基准测试,因其融合了自我效能、数学焦虑与认知网络科学等概念,除数学专业能力得分外亦纳入更多维度。数据验证表明,抽样得到的 LLMs 表现出模式完整性与一致的人格特征,以及来自不同模型家族的独特特征,如类人负面数学态度、逻辑谬误以及数学过度自信。MEDS 将为学习分析专家、认知科学家以及开发更安全数学 AI 导师者提供支持。

关键词

引用

@article{arxiv.2604.27618,
  title  = {Math Education Digital Shadows for facilitating learning with LLMs: Math performance, anxiety and confidence in simulated students and AIs},
  author = {Naomi Esposito and Anthony Tricarico and Luisa Porzio and Ali Aghazadeh Ardebili and Massimo Stella},
  journal= {arXiv preprint arXiv:2604.27618},
  year   = {2026}
}