中文

EssayJudge:用于评估多模态大语言模型自动作文评分能力的多粒度基准测试

计算与语言 2025-05-21 v2 人工智能

摘要

自动作文评分(AES)在教育评估中发挥关键作用,通过提供可扩展且一致的写作任务评估。然而,传统的AES系统面临三大挑战:(1)依赖手工设计的特征,限制了泛化能力;(2)难以捕捉细粒度特征,如连贯性和论证能力;(3)无法处理多模态语境。在多模态大语言模型(MLLM)时代,我们提出了EssayJudge,这是首个用于评估AES能力的多模态基准测试,涵盖词汇、句子和篇章层面的特征。通过利用MLLM在特征特定评分和多模态语境理解方面的优势,EssayJudge旨在提供精确、语境丰富的评估,无需手工特征工程,从而解决长期存在的AES局限性。我们对18种代表性MLLM的实验揭示了AES性能与人工评估之间的差距,特别是在篇章层面特征方面,强调了MLLM-based AES研究需要进一步发展。

关键词

引用

@article{arxiv.2502.11916,
  title  = {EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models},
  author = {Jiamin Su and Yibo Yan and Fangteng Fu and Han Zhang and Jingheng Ye and Xiang Liu and Jiahao Huo and Huiyu Zhou and Xuming Hu},
  journal= {arXiv preprint arXiv:2502.11916},
  year   = {2025}
}

备注

Accepted by ACL Findings 2025