LLM-as-a-Judge 综述
计算与语言
2025-10-21 v6 人工智能
摘要
准确且一致的评估在诸多领域的决策中至关重要,但由于内在的主观性、可变性和规模因素,这仍然是一个具有挑战性的任务。大型语言模型(LLM)在 diverse 领域取得了显著的成功,导致 "LLM-as-a-Judge" 这一概念的出现,即利用 LLM 作为复杂任务的评估者。凭借处理多样数据类型并提供可扩展、高性价比且一致评估的能力,LLM 成为传统专家驱动评估的引人入胜的替代方案。然而,确保 LLM-as-a-Judge 系统的可靠性仍然是一个重要挑战,需要谨慎的设计和标准化。本文提供了关于 LLM-as-a-Judge 的全面综述,围绕核心问题展开:如何构建可靠的 LLM-as-a-Judge 系统?我们探讨了增强可靠性的策略,包括提高一致性、缓解偏见以及适应多样化评估场景。此外,我们提出了评估 LLM-as-a-Judge 系统可靠性的方法,并支持一个专为此目的设计的新型基准。为推动 LLM-as-a-Judge 系统的开发和实际部署,我们还讨论了实际应用、挑战及未来方向。本综述为该快速演化领域的研究者和实践者提供了基础参考文献。
关键词
引用
@article{arxiv.2411.15594,
title = {A Survey on LLM-as-a-Judge},
author = {Jiawei Gu and Xuhui Jiang and Zhichao Shi and Hexiang Tan and Xuehao Zhai and Chengjin Xu and Wei Li and Yinghan Shen and Shengjie Ma and Honghao Liu and Saizhuo Wang and Kun Zhang and Yuanzhuo Wang and Wen Gao and Lionel Ni and Jian Guo},
journal= {arXiv preprint arXiv:2411.15594},
year = {2025}
}
备注
Project Page: https://awesome-llm-as-a-judge.github.io/