Conformal Bandits:为小间隙机制带来统计有效性与奖励效率
机器学习
2025-12-11 v1
摘要
我们引入了 Conformal Bandits,这是一个将保形预测(CP)集成到 Bandit 问题(不确定性下序贯决策的经典范式)中的新框架。传统的最小化遗憾 Bandit 策略,如 Thompson Sampling 和 Upper Confidence Bound (UCB),通常依赖于分布假设或渐近保证;此外,它们主要关注遗憾,而忽略了其统计特性。我们解决了这一空白。通过采用 CP,我们将决策 Bandit 策略的最小化遗憾潜力与有限时间预测覆盖率的统计保证联系起来。我们通过仿真研究和对投资组合分配(一种典型的小间隙机制,其中臂奖励差异极小,使得经典策略无法在有限样本中实现最优遗憾界)的应用,展示了 Conformal Bandits 的潜力。受此启发,我们展示了我们的框架在小间隙机制下在遗憾方面的实际优势,以及在经典 UCB 策略失效时实现名义覆盖率保证的附加价值。针对我们感兴趣的应用,我们进一步说明了如何集成隐马尔可夫模型以捕捉金融市场的机制切换行为,从而增强探索-利用权衡,并转化为更高的风险调整遗憾效率回报,同时保持覆盖率保证。
引用
@article{arxiv.2512.09850,
title = {Conformal Bandits: Bringing statistical validity and reward efficiency to the small-gap regime},
author = {Simone Cuonzo and Nina Deliu},
journal= {arXiv preprint arXiv:2512.09850},
year = {2025}
}