中文

xFinder:大语言模型作为自动评估器的可靠评估

计算与语言 2025-02-26 v3

摘要

大语言模型(LLM)的持续进步带来了开发公平且可靠评估方法的关键问题。特别是,测试集泄露和提示格式过拟合等作弊现象,构成了对LLM可靠评估的重大挑战。由于评估框架常用正则表达式(RegEx)进行答案提取,模型可能会调整其响应以适应RegEx易处理的格式。然而,基于RegEx的关键答案提取模块经常遭受提取错误。此外,最近提出的微调LLM作为评判模型的研究在泛化能力和公平性方面面临挑战。本文全面分析了LLM评估链的整个过程,表明优化关键答案提取模块可提高提取准确率并增强评估可靠性。我们的发现表明,改进关键答案提取模块可实现更高的判断准确率和更高的评估效率。为解决这些问题,我们提出xFinder,一种用于LLM评估中答案提取和匹配的新型评估器。作为本过程的一部分,我们创建了一个专业数据集,即关键答案寻找器(KAF)数据集,以确保有效的模型训练和评估。泛化测试和实际评估显示,仅需5亿参数的最小xFinder模型,即可实现93.42%的平均提取准确率。相比之下,最佳评估框架的RegEx准确率为74.38%。xFinder的最终判断准确率达到97.61%,超越现有评估框架和评判模型。

关键词

引用

@article{arxiv.2405.11874,
  title  = {xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation},
  author = {Qingchen Yu and Zifan Zheng and Shichao Song and Zhiyu Li and Feiyu Xiong and Bo Tang and Ding Chen},
  journal= {arXiv preprint arXiv:2405.11874},
  year   = {2025}
}

备注

Accepted by ICLR 2025