中文

随机多臂老虎机中的广义风险规避

机器学习 2014-05-06 v1 机器学习

摘要

我们考虑在随机多臂老虎机中最小化遗憾的问题,其中臂的优劣度量不是平均回报,而是均值和方差的某个广义函数。我们刻画了学习成为可能的条件,并给出了没有任何自然算法能够实现次线性遗憾的示例。

关键词

引用

@article{arxiv.1405.0833,
  title  = {Generalized Risk-Aversion in Stochastic Multi-Armed Bandits},
  author = {Alexander Zimin and Rasmus Ibsen-Jensen and Krishnendu Chatterjee},
  journal= {arXiv preprint arXiv:1405.0833},
  year   = {2014}
}