中文

安全线性调平赌博机

机器学习 2021-12-14 v1

摘要

多臂赌博机(MAB)在各种以随时间\textit{最大化}动作结果(即奖励)为目标的环境中被广泛研究。由于安全性在许多现实问题中至关重要,MAB 算法的安全版本也引起了相当的关注。在本文中,我们通过\textit{线性随机赌博机}的视角处理一项不同的关键任务:目标是使动作结果接近目标水平,同时遵守\textit{双侧}安全约束,我们称之为\textit{调平}。此类任务在众多领域中普遍存在。例如,许多医疗健康问题要求将生理变量保持在某一范围内且最好接近目标水平。我们目标的根本性改变需要一种新的采集策略,而这正是 MAB 算法的核心。我们提出 SALE-LTS:基于线性 Thompson 采样的安全调平算法,采用一种新颖的采集策略以适应我们的任务,并证明其获得了与先前无安全约束的经典奖励最大化问题相同的关于时间与维度依赖性的次线性后悔。我们通过详尽的实验细致展示并讨论了算法的经验性能。

关键词

引用

@article{arxiv.2112.06728,
  title  = {Safe Linear Leveling Bandits},
  author = {Ilker Demirel and Mehmet Ufuk Ozdemir and Cem Tekin},
  journal= {arXiv preprint arXiv:2112.06728},
  year   = {2021}
}

备注

17 pages, 4 figures