CodingTeachLLM:通过AST先验知识增强大语言模型的编码能力
机器学习
2025-04-02 v2 人工智能
计算与语言
摘要
本文介绍CodingTeachLLM,一个专为编码教学设计的大语言模型(LLM)。特别地,我们旨在增强LLM的编码能力,并引导其在教育场景中进入更好的教学模式。为此,我们提出一种端到端的基于先验的三阶段监督微调模型,该模型被证明比传统微调方法更具竞争力。具体而言,我们的模型实现了教育知识的结构化拆解和增量引导式输出。为此,我们通过采样器和重叠估计神经网络对三类数据进行稳健分类,并将预处理数据集分三批注入预训练模型进行LORA微调。然后,我们设计了一个先验模块,耦合系统提示、向量数据库和抽象语法树任务分割。最后,对基于先验的微调模型应用压缩方法和正则化约束,并在输出端通过文本过滤器获得增量引导式结果。我们的模型代表了首次真正体现导师角色的研究工作,具有丰富的教育知识、逐步增量引导式输出和不披露答案的特征。大量实验表明,与开源模型相比,我们的模型在编码能力方面也达到了最先进水平,在HumanEval(@pass 1)基准上达到令人瞩目的75.10%。此外,我们的模型保持了强大的对话能力,其13B量化版本在MMLU、C-Eval和AGIEval(5 shot)对话评估基准上分别获得56.34、50.60和45.27分。
引用
@article{arxiv.2403.15426,
title = {CodingTeachLLM: Empowering LLM's Coding Ability via AST Prior Knowledge},
author = {Zhangquan Chen and Chunjiang Liu and Haobin Duan},
journal= {arXiv preprint arXiv:2403.15426},
year = {2025}
}
备注
9 pages, 2 figures