SCOPE: 选择性保守优化成对 LLM 评判
计算与语言
2026-02-20 v2 人工智能
摘要
大型语言模型 (LLM) 正越来越多地被用作取代昂贵人类偏好标签的评判器。在实际性方面,LLM 评判器仍容易出现误校准和系统性偏见。本文提出了SCOPE (Selective Conformal Optimized Pairwise Evaluation),一个在有限样本统计保证下进行选择性成对评判的框架。在交换性假设下,SCOPE校准接受阈值,以确保在不放弃评判的案例中,错误率最多为用户指定的水平 。为了为SCOPE提供无偏不确定性信号,我们引入了双向偏好熵 (Bidirectional Preference Entropy, BPE),该方法在两种响应位置下查询评判器,将隐含的偏好概率汇聚以强制响应顺序不变性,并将汇聚概率转换为基于熵的不确定性得分。在MT-Bench、RewardBench和Chatbot Arena上,BPE在不确定性质量方面优于标准置信度代理,提供更强的选择信号,使SCOPE能够在保持良好覆盖率的同时始终满足目标风险水平。特别是,在时,SCOPE在所有基准和评判器规模下均满足风险限制(经验风险约为0.097至0.099),同时保持相当大的覆盖率,在Qwen-14B上的RewardBench达到0.89,在Qwen-32B上的RewardBench达到0.98。与朴素基线相比,在相同目标风险约束下,SCOPE在Qwen-7B上MT-Bench接受的评判最多增加2.4倍,表明BPE使得LLM基于评估可靠且高覆盖。
引用
@article{arxiv.2602.13110,
title = {SCOPE: Selective Conformal Optimized Pairwise LLM Judging},
author = {Sher Badshah and Ali Emami and Hassan Sajjad},
journal= {arXiv preprint arXiv:2602.13110},
year = {2026}
}