基于成对比较预言机的连续臂老虎机优化
机器学习
2025-05-29 v1 机器学习
摘要
本文研究一个老虎机优化问题,目标是在 个周期内最大化某个未知的强凹函数 。我们考虑一种新的成对比较预言机,决策者选择一对动作 并持续连续若干个周期,随后获得 的估计值。我们表明这种成对比较预言机在联合定价与库存补充问题以及网络收益管理中具有重要应用。该老虎机优化的挑战是双重的。首先,决策者不仅需要确定一对动作 ,还需要确定一个停止时间 (即基于 的查询次数)。其次,受我们库存应用的启发,差值 的估计是有偏的,这不同于随机优化文献中现有的预言机。为了应对这些挑战,我们首先引入离散化技术和局部多项式逼近,将该问题与线性老虎机联系起来。然后我们开发了一种锦标赛式逐步淘汰技术来定位离散化单元,并在单元上运行交互式分批版本的 LinUCB 算法。我们建立了直至多对数因子最优的遗憾界。此外,我们将提出的算法和分析框架应用于两个运营管理问题,获得了优于现有文献中 SOTA 的结果。
引用
@article{arxiv.2505.22361,
title = {Continuum-armed Bandit Optimization with Batch Pairwise Comparison Oracles},
author = {Xiangyu Chang and Xi Chen and Yining Wang and Zhiyi Zeng},
journal= {arXiv preprint arXiv:2505.22361},
year = {2025}
}