EssayBench:评估大型语言模型在多体裁中文作文写作中的能力
计算与语言
2025-06-04 v1 人工智能
摘要
中文作文写作及其评价在教育语境中至关重要,但大型语言模型(LLM)在这一领域的能力在很大程度上尚未被充分探索。现有的基准通常依赖于粗粒度的文本质量指标,很大程度上忽略了中文作文的结构和修辞复杂性,尤其是在不同体裁之间。为了填补这一空白,我们提出了 EssayBench,这是一个专门为中文作文写作设计的多体裁基准,涵盖四种主要体裁:议论文、记叙文、描写文和说明文。我们精心挑选并完善了总共 728 个真实世界的提示词以确保真实性,并将它们细致地分类为“开放式”和“约束式”集合,以捕捉多样的写作场景。为了可靠地评估生成的作文,我们开发了一个细粒度的、特定体裁的评分框架,该框架以分层方式聚合分数。我们通过一项全面的人类一致性研究进一步验证了我们的评估方案。最后,我们对 15 个大型 LLM 进行了基准测试,分析了它们在不同体裁和指令类型上的优势与局限。借助 EssayBench,我们旨在推进基于 LLM 的中文作文评估,并激发未来关于在教育环境中改进作文生成的研究。
引用
@article{arxiv.2506.02596,
title = {EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing},
author = {Fan Gao and Dongyuan Li and Ding Xia and Fei Mi and Yasheng Wang and Lifeng Shang and Baojun Wang},
journal= {arXiv preprint arXiv:2506.02596},
year = {2025}
}