从生成到判断:大语言模型评估范式的机遇与挑战
人工智能
2025-09-30 v7 计算与语言
摘要
评估与评估一直是人工智能(AI)和自然语言处理(NLP)领域的关键挑战。传统方法,通常基于匹配或小模型,常在开放式和动态场景中显得不足。近期大型语言模型(LLM)的发展激发了“LLM-as-a-judge”范式,即利用LLM对各种机器学习评估场景进行评分、排序或选择。本文综述了基于LLM的判断与评估,提供了全面概述以审视这一不断演变的领域。我们首先从输入和输出视角提供定义。随后,我们引入系统性分类框架,沿着三个维度探讨LLM-as-a-judge:即将要判断什么、如何判断以及如何进行基准测试。最后,我们还概述了该新兴领域的关键挑战及前景方向。关于LLM-as-a-judge的更多资源,请访问:https://llm-as-a-judge.github.io 和 https://github.com/llm-as-a-judge/Awesome-LLM-as-a-judge。
引用
@article{arxiv.2411.16594,
title = {From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge},
author = {Dawei Li and Bohan Jiang and Liangjie Huang and Alimohammad Beigi and Chengshuai Zhao and Zhen Tan and Amrita Bhattacharjee and Yuxuan Jiang and Canyu Chen and Tianhao Wu and Kai Shu and Lu Cheng and Huan Liu},
journal= {arXiv preprint arXiv:2411.16594},
year = {2025}
}
备注
EMNLP 2025