中文

LLM-as-a-Judge:重新评估大语言模型在抽取式问答中的表现

计算与语言 2025-04-23 v2

摘要

抽取式阅读理解问答(QA)数据集通常使用精确匹配(Exact Match, EM)和F1分数进行评估,但这些指标往往难以完全捕捉模型的表现。随着大语言模型(LLM)的成功,它们被广泛应用于各种任务,包括作为评判员(LLM-as-a-judge)。本文在四个阅读理解QA数据集上重新评估了QA模型的表现。我们检验了不同家族的LLM以及各种答案类型,以评估LLM-as-a-judge在这些任务中的有效性。我们的结果表明,LLM-as-a-judge与人类判断高度相关,可以取代传统的EM/F1指标。通过使用LLM-as-a-judge,与人类判断的相关性显著提高,从0.22(EM)和0.40(F1分数)提升至0.85。这些发现确认了EM和F1指标低估了QA模型的真实表现。虽然LLM-as-a-judge在更具挑战性的答案类型(例如工作)上不够完美,但仍优于EM/F1,我们观察到在相同模型用于QA和判断任务时不存在自偏好等偏见问题。

关键词

引用

@article{arxiv.2504.11972,
  title  = {LLM-as-a-Judge: Reassessing the Performance of LLMs in Extractive QA},
  author = {Xanh Ho and Jiahao Huang and Florian Boudin and Akiko Aizawa},
  journal= {arXiv preprint arXiv:2504.11972},
  year   = {2025}
}

备注

17 pages; code and data are available at https://github.com/Alab-NII/llm-judge-extract-qa