中文

连续风险规避赌博机 Thompson Sampling 的统一理论

机器学习 2022-04-19 v4 信息论 math.IT 机器学习

摘要

本文统一了多臂赌博机问题中针对一类连续且占优的风险泛函 ρ\rho 的风险规避 Thompson sampling 算法的设计与分析。我们证明了这些连续且占优的风险泛函的广义浓度界,并表明一大类流行的风险泛函属于此类。利用我们新开发的分析工具包,我们分析了算法 ρ\rho-MTS(针对多项分布),并证明它们在 CVaR、比例风险和其他常见风险度量下具有风险规避算法的渐近最优后悔界。更一般地,我们证明了对于伯努利分布,ρ\rho-MTS 在一类被称为经验分布性能度量(EDPMs)的风险度量下具有渐近最优性;这包括众所周知的均值-方差。数值模拟表明,我们的算法所产生的后悔界相对于与算法无关的下界是相当紧的。

关键词

引用

@article{arxiv.2108.11345,
  title  = {A Unifying Theory of Thompson Sampling for Continuous Risk-Averse Bandits},
  author = {Joel Q. L. Chang and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2108.11345},
  year   = {2022}
}

备注

Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2022