中文

缩小差距:针对教育工具的开源大语言模型监督微调是专用模型的可行替代方案

计算机与社会 2025-07-09 v1 人工智能 计算与语言 软件工程

摘要

前沿大语言模型(如 ChatGPT 和 Gemini)能够解读晦涩的编译器错误,帮助初学者编程,但其计算规模、成本高昂且过度辅助的倾向使其在大规模教育应用中面临问题。本工作证明,较小的专用语言模型通过监督式微调(SFT)为教育工具提供了更可行的替代方案。我们利用一个新的 40000 条 C 编译器错误解释数据集,该数据集源自真实的入门编程(CS1/2)学生生成的编程错误,用于微调三个开源模型:Qwen3-4B、Llama-3.1-8B 和 Qwen3-32B。我们进行双重评估,结合专家人工评审和针对 8000 条响应的大规模自动化分析,使用经验证的 LLM-as-judge 小组评估。我们的结果表明,SFT 显著提升了较小模型的教育质量,实现了与大型模型相当的性能。我们分析了模型规模与质量之间的权衡,确认在高质量、领域特定数据上对紧凑、高效模型进行微调是创建专用模型驱动教育工具的强大策略。我们提供可复制的方法,以促进教育背景下生成式 AI 能力的更广泛获取。

关键词

引用

@article{arxiv.2507.05305,
  title  = {Narrowing the Gap: Supervised Fine-Tuning of Open-Source LLMs as a Viable Alternative to Proprietary Models for Pedagogical Tools},
  author = {Lorenzo Lee Solano and Charles Koutcheme and Juho Leinonen and Alexandra Vassar and Jake Renzella},
  journal= {arXiv preprint arXiv:2507.05305},
  year   = {2025}
}

备注

7 pages, 3 tables, 1 figure