中文

面向人类化评分:统一的 LLM 增强主观问题评估框架

计算与语言 2025-10-10 v1 人工智能

摘要

主观问题的自动评分在考试评估中仍是一个重要挑战,因为问题格式的多样性和学生回答的开放性。现有工作主要聚焦于特定类型的主观问题,缺乏支持包含多种问题类型的综合考试的通用性。在本文中,我们提出了一种统一的大型语言模型(LLM)增强的自动评分框架,为各种领域中所有类型主观问题提供类人化评估。我们的框架整合了四个互补模块,全面评估学生答案。除了提供内容相似性基础评估的基本文本匹配模块外,我们利用 LLM 的强大推理和生成能力:(1)比较从学生答案和参考答案中提取的关键知识点;(2)生成学生答案的伪问题,以评估其与原始问题的相关性;(3)通过识别内容相关和非内容方面的优势与弱点来模拟人类评估。在广泛的通用和领域特定数据集上进行的实验表明,我们的框架在多个评分指标上 consistently 超过传统和 LLM 基线方法。此外,该系统已成功部署在某大型电商企业的实际培训和认证考试中。

关键词

引用

@article{arxiv.2510.07912,
  title  = {Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation},
  author = {Fanwei Zhua and Jiaxuan He and Xiaoxiao Chen and Zulong Chen and Quan Lu and Chenrui Mei},
  journal= {arXiv preprint arXiv:2510.07912},
  year   = {2025}
}