中文

LLMs-as-Judges:LLM 评估方法综合调查

计算与语言 2024-12-11 v2 信息检索

摘要

大型语言模型 (LLM) 的快速发展推动了它们在各个领域的应用扩展。最具前景的应用之一是作为基于自然语言响应的评估者,称为 ''LLMs-as-judges''。这一框架由于其出色的有效性、跨任务的可泛化能力以及以自然语言形式的可解释性,吸引了 academia 和 industry 的广泛关注。本文从五个关键视角对 LLMs-as-judges 范式进行全面调查:功能性、方法论、应用、元评估和局限性。我们首先提供了 LLMs-as-Judges 的系统性定义,介绍其功能性 (为何要使用 LLM 评估者?)。然后我们讨论构建 LLM 评估系统的方法 (如何使用 LLM 评估者?)。此外,我们调查了其潜在应用领域 (在哪里使用 LLM 评估者?),并讨论了在各种上下文中对其进行评估的方法 (如何评估 LLM 评估者?)。最后,我们详细分析了 LLM 评估者的局限性,并讨论了潜在的未来方向。通过结构化和全面的分析,旨在为研究和实践中 LLMs-as-judges 的开发和应用提供见解。我们将持续维护相关资源列表,地址为 https://github.com/CSHaitao/Awesome-LLMs-as-Judges。

关键词

引用

@article{arxiv.2412.05579,
  title  = {LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods},
  author = {Haitao Li and Qian Dong and Junjie Chen and Huixue Su and Yujia Zhou and Qingyao Ai and Ziyi Ye and Yiqun Liu},
  journal= {arXiv preprint arXiv:2412.05579},
  year   = {2024}
}

备注

60 pages, comprehensive and continuously updated