预算学习中的比率指标及其应用
数据结构与算法
2016-04-12 v2
摘要
在预算学习问题中,我们被允许在一组备选方案上进行实验(给定固定的实验预算),目标是挑选一个具有最大可能期望收益的单一方案。Guha和Munagala通过求解一个耦合各备选方案的线性规划,开发了该问题的近似算法。在本文中,我们提出了该问题的一个指标,称为比率指标,它也能保证常数因子近似。基于指标的策略的优势在于,可以独立于所有其他备选方案为每个备选方案计算一个单一数值(即指标),并且对具有最高指标的备选方案进行实验。这类似于著名的折扣多臂赌博机问题的Gittins指标。比率指标具有几个有趣的结构性质。首先,我们证明它可以在强多项式时间内计算。其次,我们证明,在适当的折扣因子下,Gittins指标和我们的比率指标互为常数因子近似,因此Gittins指标也为预算学习问题提供了常数因子近似。最后,我们证明比率指标可用于创建一种基于指标的策略,该策略对多臂赌博机问题的有限时间版本实现了O(1)-近似。此外,该策略不需要任何关于时间范围的知识(而我们将其性能与一个知晓时间范围的最优策略进行比较)。这得出了以下令人惊讶的结果:存在一种基于指标的策略,对多臂赌博机问题实现了O(1)-近似,且对潜在的折扣因子一无所知。
引用
@article{arxiv.0810.0558,
title = {The Ratio Index for Budgeted Learning, with Applications},
author = {Ashish Goel and Sanjeev Khanna and Brad Null},
journal= {arXiv preprint arXiv:0810.0558},
year = {2016}
}
备注
This paper has a substantial bug that we are trying to fix. Many thanks to Joe Halpern for pointing this bug out. Please do not cite in the meantime. Please let us know if you would like to understand and/or try to fix the bug