边际自适应置信排序:可靠 LLM 判断的置信排名
机器学习
2026-05-18 v1 人工智能
摘要
Jung 等人 (2025) 引入了一种假设检验框架,用于保证大型语言模型 (LLM) 与人类判断之间的一致性,其假设是模型的估计置信度与人类不一致风险单调相关。然而在实际应用中,这一假设可能被违反,而置信估计器的泛化行为也未被明确分析。我们通过学习专门的置信估计器来缓解这些问题,而不是依赖启发式置信信号。我们的ethods 利用模拟的评 annotator 多样性和基于边际的排序公式,显式建模 LLM 如何在人类一致与人类不一致案例之间进行区分。我们进一步推导了该估计器的泛化保证,揭示了一种边际依赖的权衡,为自适应估计器训练程序的设计提供指导。当集成到固定序列测试中时,所学置信估计器会提高排序准确性,并在实际操作中加强了置信度与不一致风险之间的单调关系,导致在多个数据集和评判模型上,满足目标一致性水平的成功率提高。
引用
@article{arxiv.2605.15416,
title = {Margin-Adaptive Confidence Ranking for Reliable LLM Judgement},
author = {Gaojie Jin and Yong Tao and Lijia Yu and Tianjin Huang},
journal= {arXiv preprint arXiv:2605.15416},
year = {2026}
}
备注
Accepted to ICML 2026