中文

均值-方差度量下的风险厌恶多臂老虎机问题

机器学习 2017-08-16 v3

摘要

多臂老虎机问题主要在长度为 TT 的时域内累积期望总奖励的度量下被研究。在本文中,我们处理多臂老虎机问题中的风险问题,并在均值-方差度量下发展平行结果,均值-方差是经济学和数学金融中常采用的风险度量。我们表明,就奖励过程的均值-方差而言,模型相关遗憾和模型无关遗憾分别被 Ω(logT)\Omega(\log T)Ω(T2/3)\Omega(T^{2/3}) 下界限制。然后我们表明,为经典风险中性MAB开发的UCB策略和DSEE策略的变体达到了这些下界。

关键词

引用

@article{arxiv.1604.05257,
  title  = {Risk-Averse Multi-Armed Bandit Problems under Mean-Variance Measure},
  author = {Sattar Vakili and Qing Zhao},
  journal= {arXiv preprint arXiv:1604.05257},
  year   = {2017}
}