基于推理蒸馏的评估方法提升自动作文评分
计算与语言
2024-07-22 v1 计算机与社会
机器学习
摘要
最近,各种仅编码器和编码器-解码器预训练模型如 BERT 和 T5 被应用于自动作文评分(AES)作为小型语言模型。然而,现有研究主要将此任务类比为分类问题,仅关注输出目标文本中的分数,而不为生成的分数提供解释。不同于这种方法,我们引入了推理蒸馆基于评估(Reasoning Distillation-Based Evaluation, RDBE),该方法将可解释性整合到解释模型分数背后原因的同时,通过初始推理来提高性能。这种可解释能力是在训练期间通过利用大语言模型(LLM)生成的推理来蒸馊到小型语言模型(SLM)中获得的。我们的实验结果在数据集中考虑的所有评分规范方面都证明了 RDBE 的有效性。RDBE 在零样例 LLM 生成以及来自基线微调模型的生成方面均表现优异,确立了其在相应数据集中的最先进地位。这突显了其实用性强的可解释输出和提高的性能。
引用
@article{arxiv.2407.13781,
title = {RDBE: Reasoning Distillation-Based Evaluation Enhances Automatic Essay Scoring},
author = {Ali Ghiasvand Mohammadkhani},
journal= {arXiv preprint arXiv:2407.13781},
year = {2024}
}