用于科学教育评估自动评分的LLM知识蒸馏
计算与语言
2024-06-13 v3 人工智能
摘要
本研究提出了一种知识蒸馏(KD)方法,将微调后的大语言模型(LLM)蒸馏成更小、更高效且更准确的神经网络。我们特别针对在资源受限设备上部署这些模型的挑战。我们的方法包括使用LLM(作为教师模型)的预测概率(作为软标签)来训练较小的学生模型(神经网络)。这是通过一个专门设计的损失函数实现的,该函数旨在从LLM的输出概率中学习,确保学生模型紧密模仿教师模型的性能。为了验证KD方法的性能,我们使用了一个大型数据集7T,包含6684个学生对科学问题的书面回答,以及三个由人类专家评分的数学推理数据集。我们将准确率与最先进的(SOTA)蒸馏模型TinyBERT和人工神经网络(ANN)模型进行了比较。结果表明,KD方法的评分准确率分别比ANN和TinyBERT高3%和2%,并且与教师模型的准确率相当。此外,学生模型大小为0.03M,参数比教师模型小4000倍,推理速度比TinyBERT快10倍。这项研究的意义在于其潜力,使先进的AI技术能够在典型的教育环境中得到应用,特别是用于自动评分。
引用
@article{arxiv.2312.15842,
title = {Knowledge Distillation of LLM for Automatic Scoring of Science Education Assessments},
author = {Ehsan Latif and Luyang Fang and Ping Ma and Xiaoming Zhai},
journal= {arXiv preprint arXiv:2312.15842},
year = {2024}
}
备注
Accepted to AIED2024