中文

释放大语言模型在零样本作文评分中的能力

计算与语言 2024-10-07 v2

摘要

自动作文评分(Automated Essay Scoring, AES)的进展传统上依赖于标注好的作文,获取这些标注需要巨大的成本和专业知识。近期,大语言模型(LLM)在各类任务中取得了巨大成功,但其在 AES 中的潜力鲜少被探索。在本文中,我们展示了我们的零样本提示框架——多特质专门化(Multi Trait Specialization, MTS),能够激发 LLM 在作文评分方面的巨大潜力。具体而言,我们自动将写作能力分解为不同的特质,并为每个特质生成评分标准。随后,提示 LLM 通过几轮对话提取特质分数,每一轮根据评分标准对其中一个特质进行评分。最后,我们通过特质平均和 min-max 缩放得出总分。在两个基准数据集上的实验结果表明,在所有 LLM 和数据集上,MTS 在平均 QWK 分数上始终优于直接提示(Vanilla),在 TOEFL11 和 ASAP 上分别取得了 0.437 和 0.355 的最大提升。此外,在 MTS 的帮助下,小型的 Llama2-13b-chat 显著优于 ChatGPT,促进了其在实际应用中的有效部署。

关键词

引用

@article{arxiv.2404.04941,
  title  = {Unleashing Large Language Models' Proficiency in Zero-shot Essay Scoring},
  author = {Sanwoo Lee and Yida Cai and Desong Meng and Ziyang Wang and Yunfang Wu},
  journal= {arXiv preprint arXiv:2404.04941},
  year   = {2024}
}