约束下子集选择的多臂 Bandit 方法
机器学习
2021-02-10 v1
摘要
我们探索一类问题:一个中央规划者需要选择一组智能体,每个智能体具有不同的质量与成本。规划者希望在确保所选智能体的平均质量高于某阈值的同时最大化其效用。当智能体的质量已知时,我们将问题表述为整数线性规划(ILP)并提出一种确定性算法,即 \dpss,为我们的 ILP 提供精确解。接着我们考虑智能体质量未知的情形。我们将其建模为多臂 Bandit(MAB)问题,并提出 \newalgo 在多个轮次中学习质量。我们证明在经过一定轮数 τ 后,\newalgo 以高概率输出满足平均质量约束的智能体子集。接下来,我们给出 τ 的界,并证明在 τ 轮后算法产生的后悔值为 O(ln T),其中 T 为总轮数。我们通过仿真进一步说明 \newalgo 的有效性。为克服 \dpss 的计算局限,我们提出一种多项式时间贪心算法,即 \greedy,为我们的 ILP 提供近似解。我们还通过实验比较了 \dpss 与 \greedy 的性能。
引用
@article{arxiv.2102.04824,
title = {A Multi-Arm Bandit Approach To Subset Selection Under Constraints},
author = {Ayush Deva and Kumar Abhishek and Sujit Gujar},
journal= {arXiv preprint arXiv:2102.04824},
year = {2021}
}
备注
Accepted in AAMAS 2021 as Extended Abstract