将LLM评判家康补充到人类评估中:您需要多少人类评论?
机器学习
2026-05-19 v1 人工智能
计算与语言
人机交互
机器学习
摘要
大型语言模型(LLM)越来越多地被用作AI系统的自动评估器,甚至在高风险应用中发挥作用。在此角色下,LLM用于生成关于模型输出质量、合适性或安全性的判断。这种做法的动机来自实际限制:专家人类评分成本高昂且难以规模化,而LLM评分可快速低成本生成。然而,现有部署LLM评估器的做法不系统,通常仅报告人类与LLM评判家之间的一致性指标,以正当化取代人类评分,缺乏正式的研究设计依据。本文(1)将LLM评判家的角色从替代性转为辅助性,(2)将LLM作为评判家的范式建模为通过两阶段抽样设计来补充人类评估,即第一阶段对所有观测进行LLM评估,第二阶段对子样本进行人类评分。我们提出使用缺失数据文献中的双鲁棒估计器,该估计器利用了对预测模型的鲁棒性特性,因为缺失模型是通过设计已知的。借助该估计器的渐近方差,我们提出如何确定人类和LLM评分的样本量,以实现目标功效水平。我们还展示,可通过为LLM可预测性不高的评估类型分配更多人类评分来有效设计研究。据我们了解,目前几乎没有关于在验证基准时应保留多少人工监督方面的指导。
引用
@article{arxiv.2605.16354,
title = {Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?},
author = {Jane Paik Kim},
journal= {arXiv preprint arXiv:2605.16354},
year = {2026}
}
备注
10 pages, 5 figures