中文

基于项目反应理论诊断 LLM 评判器的可靠性

人工智能 2026-02-03 v1

摘要

虽然 LLM-as-a-Judge 在自动化评估中被广泛使用,但现有的验证实践主要针对观察到的输出进行,仅能提供有限的关于 LLM 评判器本身是否作为稳定可靠的测量仪器的线索。为此,我们引入了一个基于项目反应理论(IRT)的两阶段诊断框架,用于评估 LLM-as-a-Judge 的可靠性。该框架采用 IRT 的分级响应模型(GRM),并沿着两个互补维度正式化可靠性:(1)内在一致性,定义为在提示词变化下的测量行为稳定性;(2)人类一致性,捕捉与人类质量评估的对应关系。我们经实证研究多种 LLM 评判器,表明利用 IRT-GRM 可为系统性诊断判断提供可解释信号。这些信号为验证 LLM-as-a-Judge 的可靠性以及识别不可靠性潜在原因提供了实用指导。

关键词

引用

@article{arxiv.2602.00521,
  title  = {Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory},
  author = {Junhyuk Choi and Sohhyung Park and Chanhee Cho and Hyeonchu Park and Bugeun Kim},
  journal= {arXiv preprint arXiv:2602.00521},
  year   = {2026}
}

备注

Under review