带 LLM 评判器且人类资源有限的最佳臂识别
机器学习
2026-01-30 v1 最优化与控制
机器学习
摘要
我们研究固定置信度的最佳臂识别(BAI),其中可获得每样本的廉价但可能偏置的代理(如 LLM 评判器),而昂贵的真实标签只能在特定时刻获取。与经典多保真度 BAI 不同,代理是有偏的(受臂和情境影响),且真实标签是选择性获取。因此,标准的多保真度方法可能误选最佳臂,统一审计虽然准确但浪费稀缺资源且效率低下。我们证明,在无偏差纠正和倾向调整的情况下,即使拥有 unlimited 代理数据,误选概率也可能无法消除。随后,我们开发了一个结合代理评分与逆倾向加权残差的每臂均值估计器,并为该估计器构建随时间有效的置信序列。基于该估计器和置信序列,我们提出一个算法,自适应选择并审计臂力。该算法集中审计不可靠情境和接近的臂力,我们证明,插拔式纽曼规则可实现接近或acles的审计效率。数值实验确认了理论保证,展示了所提算法的优异经验性能。
引用
@article{arxiv.2601.21471,
title = {Best Arm Identification with LLM Judges and Limited Human},
author = {Ruicheng Ao and Hongyu Chen and Siyang Gao and Hanwei Li and David Simchi-Levi},
journal= {arXiv preprint arXiv:2601.21471},
year = {2026}
}
备注
22 pages, 3 figures