中文

具有动作延迟影响的_bandit_学习

机器学习 2021-11-02 v4 机器学习

摘要

我们考虑一种具有动作延迟影响的多臂 bandit (MAB) 问题。在我们的设定中,过去采取的动作会影响后续未来的臂奖励。这种动作的延迟影响在现实世界中十分普遍。例如,某一社会群体人群的贷款偿还能力可能取决于该群体历史上贷款申请被批准的频率。如果银行持续拒绝弱势群体的贷款申请,可能会形成反馈循环,进一步损害该群体人群获得贷款的机会。在本文中,我们在多臂 bandit 的框架下形式化了这种动作的延迟与长期影响。我们推广了 bandit 设定以编码由于学习过程中动作历史所产生的这种“偏差”的依赖性。目标是在考虑由历史动作的延迟影响所产生的动态的同时,最大化随时间收集的效用。我们提出了一种算法,其 regret 达到 O~(KT2/3)\tilde{\mathcal{O}}(KT^{2/3}),并给出了匹配的 regret 下界 Ω(KT2/3)\Omega(KT^{2/3}),其中 KK 为臂的数量,TT 为学习时域。我们的结果通过补充处理具有长期影响动作的技术来完善 bandit 文献,并对公平算法的设计具有启示意义。

关键词

引用

@article{arxiv.2002.10316,
  title  = {Bandit Learning with Delayed Impact of Actions},
  author = {Wei Tang and Chien-Ju Ho and Yang Liu},
  journal= {arXiv preprint arXiv:2002.10316},
  year   = {2021}
}