中文

面向个性化学习指导的大语言模型基准测试

人工智能 2025-10-23 v2

摘要

尽管大语言模型(LLM)日益被视为个人化学习的智能助手,但在真实学习情境下的系统性对标评估仍寥寥。本研究在模拟真实学习情境的辅导任务中,对三种最先进的 LLM 进行经验比较。我们使用包含学生对十个混合格式问题的响应及正确性标签的数据集,让每个模型分别执行:(i)分析测验以识别潜在知识组件,(ii)推断学生的掌握程度轮廓,(iii)生成针对性改进指导。为缓解主观性和评估者偏见,我们使用 Gemini 作为虚拟评委,对结果在准确性、清晰性、可操作性和适当性等多个维度进行成对比较。通过Bradley-Terry模型分析结果表明,GPT-4o 总体受到偏好,生成的反馈在信息量和结构性方面优于其他模型,而DeepSeek-V3 和 GLM-4.5 则表现出间歇性优势但一致性较低。这些发现凸显了将 LLM 部署为高级教学助手以提供个性化支持的可行性,并为后续 LLM 驱动的个性化学习研究提供了方法论见解。

关键词

引用

@article{arxiv.2509.05346,
  title  = {Benchmarking Large Language Models for Personalized Guidance in AI-Enhanced Learning},
  author = {Bo Yuan and Jiazi Hu},
  journal= {arXiv preprint arXiv:2509.05346},
  year   = {2025}
}