超越静态偏差:基于改进代理的自适应多保真 bandit
机器学习
2026-05-12 v1
摘要
作为经典多臂老虎机问题的扩展,多保真多臂老虎机 (MF-MAB) 允许单个臂端于多样化的反馈来源,这些来源在成本和准确性方面各不相同。先前的随机模型通常假设固定的低到高保真差异,而现代代理源,如基于学习的模拟器和大型语言模型 (LLM),可以通过额外校准来改进。我们研究具有改进代理源的自适应 MF-MAB,聚焦于低保真来源随重复使用而变得更具信息量的标准双保真情况。为捕捉这种动态,我们引入一种所选平均不匹配界限,将动态低保真观察转换为考虑改进的置信区间。我们提出了阈值基自适应继续伴随器 (TACC),一种乐观算法,使用受限的继续规则来决定低保真抽样何时仍具成本效益,以及何时要升级。我们证明了实例相关的 regret 界限,表明对于检测到的中间臂,自适应继续将对数高保真确认替换为受限的低保真继续。实验在合成 bandit 和 LLM 作为评判员的政策评估任务上检验了何时继续改善成本加权 regret。
关键词
引用
@article{arxiv.2605.08558,
title = {Beyond Static Bias: Adaptive Multi-Fidelity Bandits with Improving Proxies},
author = {Muyun Lu and Haoyang Hong and Huazheng Wang and Ying Lin},
journal= {arXiv preprint arXiv:2605.08558},
year = {2026}
}