中文

评估大语言模型评估器的一致性

计算与语言 2024-12-03 v1

摘要

大语言模型(LLM)显示出作为通用评估器的潜力,具有速度快、成本低等显著优势。虽然其对人类标注者的相关性已广泛研究,但作为评估器的一致性仍受到不足的关注,这引发了对LLM评估器可靠性的疑虑。本文在不同评分尺度和评判粒度上,对开源和专有模型进行了对LLM评估器两个一致性方面的广泛研究:自我一致性(Self-Consistency, SC)和跨尺度一致性(Inter-scale Consistency, IC)。我们的全面分析表明,强大的专有模型并不一定是一致的评估器,这凸显了在评估LLM评估器能力时考虑一致性的重要性。

关键词

引用

@article{arxiv.2412.00543,
  title  = {Evaluating the Consistency of LLM Evaluators},
  author = {Noah Lee and Jiwoo Hong and James Thorne},
  journal= {arXiv preprint arXiv:2412.00543},
  year   = {2024}
}

备注

Accepted to COLING 2025