中文

风险规避的非平稳多臂老虎机

机器学习 2021-09-30 v1

摘要

本文处理了当所产生损失为非平稳时的风险规避多臂老虎机问题。采用条件风险价值(CVaR)作为目标函数。针对非平稳损失下的该目标函数,本文提出了两种估计方法:一种依赖于损失的加权经验分布,另一种依赖于 CVaR 的对偶表示。这些估计值随后可嵌入到经典臂选择方法中,例如 epsilon-greedy 策略。仿真实验评估了基于这两种新颖估计方法的臂选择算法的性能,结果表明这些策略优于未考虑非平稳性的朴素基准方法。

关键词

引用

@article{arxiv.2109.13977,
  title  = {Risk averse non-stationary multi-armed bandits},
  author = {Leo Benac and Frédéric Godin},
  journal= {arXiv preprint arXiv:2109.13977},
  year   = {2021}
}