中文

一种面向非平稳随机多臂老虎机的风险规避框架

机器学习 2023-11-01 v1 机器学习

摘要

在典型的随机多臂老虎机问题中,目标通常是在某个时间范围 TT 上最大化期望奖励之和。虽然在无额外信息的情况下,选择实现该目标的策略是最优的,但当提供额外的环境特定知识时则不再如此。特别是在医疗保健或金融等波动性高的领域,朴素的奖励最大化方法往往不能准确捕捉学习问题的复杂性,并导致不可靠的解决方案。为解决此类问题,我们提出了一种在非平稳环境中运行的自适应风险感知策略框架。我们的框架结合了文献中普遍存在的各种风险度量,将多族多臂老虎机算法映射到风险敏感设置中。此外,我们为所得算法配备重启贝叶斯在线变点检测(R-BOCPD)算法,并施加(可调的)强制探索策略以检测局部(每臂)切换。我们提供了有限时间理论保证以及直至时间范围 TT 的阶为 O~(KTT)\tilde O(\sqrt{K_T T}) 的渐近后悔界,其中 KTK_T 为变点总数。在实践中,我们的框架在合成和真实世界环境中均优于最先进水平,并在风险敏感性和非平稳性方面均表现高效。

关键词

引用

@article{arxiv.2310.19821,
  title  = {A Risk-Averse Framework for Non-Stationary Stochastic Multi-Armed Bandits},
  author = {Reda Alami and Mohammed Mahfoud and Mastane Achab},
  journal= {arXiv preprint arXiv:2310.19821},
  year   = {2023}
}