具有对数后悔与风险的安全多臂老虎机策略
机器学习
2022-04-05 v1 机器学习
摘要
我们研究了一种在自然但令人惊讶地未被充分研究的、面向安全风险约束下多臂老虎机问题的方法。每个臂关联一个关于安全风险与奖励的未知分布,学习者的目标是在不选择不安全臂的前提下最大化奖励,不安全由给定平均风险阈值判定。我们为该设定制定了一种伪后悔(pseudo-regret),其以逐轮方式通过软性惩罚任何违规来强制该安全约束,而不论由此带来的奖励增益如何。这对于诸如临床试验等必须每轮维持安全而非仅从总体意义上维持安全的场景具有实际意义。我们描述了该场景下的双重乐观策略,其对安全风险与奖励均保持乐观指数。我们表明,基于频率学派与贝叶斯指数的方案均满足紧致的间隙依赖对数后悔界,并进一步表明这些方案总共仅以对数次数选择不安全臂。该理论分析辅以仿真研究,证明了所提方案的有效性,并探究了其适用领域。
引用
@article{arxiv.2204.00706,
title = {Strategies for Safe Multi-Armed Bandits with Logarithmic Regret and Risk},
author = {Tianrui Chen and Aditya Gangrade and Venkatesh Saligrama},
journal= {arXiv preprint arXiv:2204.00706},
year = {2022}
}