中文

SedarEval:基于自适应评分标准的自动化评估

计算机视觉与模式识别 2025-01-28 v1

摘要

LLM评判员评估范式因显著降低人力与时间成本而日益流行。该方法利用一个或多个大语言模型(LLM)评估其他LLM的输出质量。然而,现有方法依赖通用评分标准,未考虑各问题及其问题解决过程的特殊性,影响评估的精度与稳定性。灵感来自人类考试评分过程,我们提出基于自适应评分标准的新型评估范式。具体而言,为每个问题创建详细评分标准,结构化地捕捉主要与次要评分标准及扣分项,模拟人类评估者的分析过程。基于此范式,我们构建了名为SedarEval的新型基准,覆盖长尾知识、数学、编程和逻辑推理等多个领域。SedarEval包含1000个精心设计的问题,每个问题均配有自适应评分标准。为进一步简化评估流程,我们训练了专用评估语言模型(evaluator LM)以取代人类裁判。使用相同训练数据,我们的evaluator LM在与人类评分结果的一致性方面优于其他范式,包括GPT-4,凸显了我们方法的优越性与效率。我们已在https://github.com/wwn1233/sedareval发布数据集。

关键词

引用

@article{arxiv.2501.15595,
  title  = {SedarEval: Automated Evaluation using Self-Adaptive Rubrics},
  author = {Zhiyuan Fan and Weinong Wang and Xing Wu and Debing Zhang},
  journal= {arXiv preprint arXiv:2501.15595},
  year   = {2025}
}