双重稳健LLM-as-a-Judge:基于不完美画像的外部有效估计
机器学习
2026-03-03 v2
摘要
随着生成式人工智能(GenAI)系统得到日益广泛的应用,一个关键问题涉及评估的外部有效性,即评估结果从实验室条件推广到真实世界部署条件的程度。当用于获得系统质量估计的人类评分者与系统输出的源样本与部署时的目标分布不同时,就会对GenAI评估的外部有效性构成威胁。本文中,我们提出了一个双重稳健估计框架,旨在解决这种评估采样偏差。我们方法的关键在于使用“画像”评分,这些评分通过提示一个LLM评估器(即LLM-as-a-judge)模拟具有特定社会人口学特征的人类评分者来产生。我们的双重稳健框架将这些信息丰富但不完美的画像评分与在评估采样偏差下获得的人类评分相结合,以产生统计上有效的系统质量估计。具体而言,我们证明,当(i) 一个使用画像评分和在采样偏差下观察到的源数据训练来预测人类评分的模型,或 (ii) 一个校正采样偏差的重加权模型具有足够质量时,我们的方法能产生有效的系统质量估计。我们通过理论以及一个新颖的画像仿真框架(PSF)验证了我们的框架,该PSF旨在系统地操控画像质量以及源数据中存在的评估采样偏差程度。我们的工作为将不完美的画像评分与在采样偏差下观察到的人类评分相结合以获得有效的系统质量估计提供了原则性基础。
引用
@article{arxiv.2509.22957,
title = {Doubly-Robust LLM-as-a-Judge: Externally Valid Estimation with Imperfect Personas},
author = {Luke Guerdan and Justin Whitehouse and Kimberly Truong and Kenneth Holstein and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2509.22957},
year = {2026}
}
备注
ICLR 2026 Camera Ready