组合半_bandit的风险感知算法
机器学习
2021-12-03 v1 人工智能
摘要
本文研究半bandit反馈下的随机组合多臂bandit问题。尽管已有大量工作针对线性和某些一般奖励函数优化期望奖励的算法,我们研究该问题的一个变体,其目标是风险感知的。更具体地,我们考虑最大化条件风险价值(CVaR)的问题,这是一种仅考虑最坏情况奖励的风险度量。我们提出了新算法,在臂奖励为高斯和有界两种情况下最大化组合bandit超级臂所获奖励的CVaR。我们进一步分析了这些算法并给出了后悔界。我们相信我们的结果首次提供了风险感知情形下组合半bandit问题的理论见解。
引用
@article{arxiv.2112.01141,
title = {Risk-Aware Algorithms for Combinatorial Semi-Bandits},
author = {Shaarad Ayyagari and Ambedkar Dukkipati},
journal= {arXiv preprint arXiv:2112.01141},
year = {2021}
}