中文

大语言模型在机器学习编程教育中的评估:识别陷阱的挑战

物理学史与哲学 2025-05-27 v1 天体物理仪器与方法

摘要

大语言模型(LLM)的快速发展为教育领域开辟了新的机遇。本研究考察了 LLM 在支持机器学习教育中的作用;具体而言,关注其识别机器学习代码中常见实践错误(陷阱)的能力,以及其提供引导学习反馈的能力。我们使用一套代码样本,考察了四个不同的 LLM:一个封闭模型和三个开放模型。虽然最基本的陷阱被所有模型轻松识别,但许多常见陷阱未被识别。它们特别在识别机器学习管道早期阶段的陷阱时表现不佳,尤其是那些可能导致信息泄露的陷阱,这是实际机器学习项目中常见的失败来源。它们在识别关于模型选择的陷阱时也取得有限的成果,而这正是学生在从理论过渡到实践时常困惑的概念。本研究质疑了当前 LLM 用于支持机器学习教育的做法,也提出了对初学者实践者的重要问题。尽管如此,当 LLM 成功识别代码中的陷阱时,它们确实提供了包括如何继续前进的建议,强调了其在引导学习者方面的潜在作用。我们还比较了封闭式和开放式 LLM 模型的能力,发现尽管模型规模差异巨大,两者之间的差距相对较小。这为在教育中部署和可能定制更小更高效的 LLM 模型提供了机会,避免了商业模型在成本和数据共享方面的风险。

关键词

引用

@article{arxiv.2505.18219,
  title  = {Legacy of Avicenna in Astronomy},
  author = {Rizoi Bakhromzod},
  journal= {arXiv preprint arXiv:2505.18219},
  year   = {2025}
}

备注

16 pages, 6 figures