未知多面体上的安全线性赌博机
机器学习
2024-07-02 v3 机器学习
摘要
安全线性赌博机问题(SLB)是一种在线性规划方法,具有未知目标和未知逐轮约束,在随机赌博机反馈下获得动作的奖励和安全风险。我们研究了多面体上SLB中功效与平滑安全成本之间的权衡,以及激进的加倍乐观策略在避免现有悲观-乐观方法所做的强假设中的作用。我们首先阐明了由于缺乏约束知识而导致的SLB固有困难:存在“简单”实例,其中次优极值点具有大“间隙”,但SLB方法仍必须承受的遗憾或安全违规,因为无法将未知最优解解析到任意精度。然后,我们分析了安全线性赌博机问题的一种自然加倍乐观策略DOSS,该策略使用奖励和安全风险的乐观估计来选择动作,并表明尽管缺乏约束或可行点的知识,DOSS同时获得了紧密的实例依赖的功效遗憾界和的安全违规界。此外,当安全要求达到有限精度时,违规改进为。这些结果依赖于线性赌博机的一种新颖对偶分析:我们认为该算法通过每轮激活至少个约束的噪声版本来运行,这使我们能够分别分析激活“差”约束集合的轮次和激活“好”约束集合的轮次。前者的成本通过基于线性规划全局灵敏度分析的新对偶间隙概念控制在内,该概念量化了每个此类约束集合的次优性。后者的成本通过显式分析乐观策略的解控制在内。
引用
@article{arxiv.2209.13694,
title = {Safe Linear Bandits over Unknown Polytopes},
author = {Aditya Gangrade and Tianrui Chen and Venkatesh Saligrama},
journal= {arXiv preprint arXiv:2209.13694},
year = {2024}
}
备注
v3: Presented at COLT 2024