均值-方差度量下的风险厌恶多臂老虎机问题
机器学习
2017-08-16 v3
摘要
多臂老虎机问题主要在长度为 的时域内累积期望总奖励的度量下被研究。在本文中,我们处理多臂老虎机问题中的风险问题,并在均值-方差度量下发展平行结果,均值-方差是经济学和数学金融中常采用的风险度量。我们表明,就奖励过程的均值-方差而言,模型相关遗憾和模型无关遗憾分别被 和 下界限制。然后我们表明,为经典风险中性MAB开发的UCB策略和DSEE策略的变体达到了这些下界。
引用
@article{arxiv.1604.05257,
title = {Risk-Averse Multi-Armed Bandit Problems under Mean-Variance Measure},
author = {Sattar Vakili and Qing Zhao},
journal= {arXiv preprint arXiv:1604.05257},
year = {2017}
}