中文

保守上下文组合级联_bandit

机器学习 2021-04-26 v2 机器学习

摘要

保守机制是决策问题中一种理想的特性,它平衡了探索与利用之间的权衡。我们提出了新颖的\emph{保守上下文组合级联_bandit(C4C^4-bandit)},这是一种融合了保守机制的级联在线学习博弈。在每一步,学习智能体被给定若干上下文,必须推荐一个物品列表且不能差于基准策略,然后根据某些停止规则观测奖励。我们设计了 C4C^4-UCB 算法来求解该问题,并证明了其在两种情形下的 nn 步后悔上界:已知基线奖励与未知基线奖励。两种情形下的后悔均可分解为两项:(a) 一般上下文组合级联_bandit 的上界;以及 (b) 来自保守机制后悔的常数项。作为副产品,我们还改进了保守上下文组合_bandit 的界。在合成数据上的实验证明了其优势并验证了我们的理论分析。

关键词

引用

@article{arxiv.2104.08615,
  title  = {Conservative Contextual Combinatorial Cascading Bandit},
  author = {Kun Wang and Canzhe Zhao and Shuai Li and Shuo Shao},
  journal= {arXiv preprint arXiv:2104.08615},
  year   = {2021}
}