使用大型语言模型进行自动作文评分时,我们需要详细的评分细则吗?
计算与语言
2025-05-05 v1
摘要
本研究探讨了在使用大型语言模型 (LLM) 进行自动作文评分 (AES) 时,详细评分细则的必要性及其影响。虽然在基于 LLM 的 AES 中使用评分细则是标准做法,但创建详细的评分细则需要大量的努力并增加了 token 使用量。我们使用 TOEFL11 数据集,研究了不同级别的评分细则细节如何影响多个 LLM 的评分准确性。我们的实验比较了三种条件:完整评分细则、简化评分细则和无评分细则,使用了四种不同的 LLM(Claude 3.5 Haiku、Gemini 1.5 Flash、GPT-4o-mini 和 Llama 3 70B Instruct)。结果显示,四分之三的模型在使用简化评分细则时保持了与详细评分细则相似的评分准确性,同时显著减少了 token 使用量。然而,有一个模型(Gemini 1.5 Flash)在使用更详细的评分细则时表现出性能下降。研究结果表明,对于大多数基于 LLM 的 AES 应用,简化的评分细则可能就足够了,这提供了一种更高效的替代方案,而不会影响评分准确性。然而,由于不同 LLM 的性能模式各异,针对特定模型的评估仍然至关重要。
引用
@article{arxiv.2505.01035,
title = {Do We Need a Detailed Rubric for Automated Essay Scoring using Large Language Models?},
author = {Lui Yoshida},
journal= {arXiv preprint arXiv:2505.01035},
year = {2025}
}
备注
Accepted in AIED 2025. This preprint has not undergone any post-submission improvements or corrections