中文

已知奖励函数的随机上下文赌博机

机器学习 2016-05-10 v2

摘要

通信网络中的许多序贯决策问题可建模为上下文赌博机问题,它们是著名的多臂赌博机问题的自然扩展。在上下文赌博机问题中,每时刻一个智能体观测到某些边信息或上下文,拉动一个臂并接收该臂的奖励。我们考虑一种随机表述,其中上下文-奖励元组在每次试验时独立地从未知分布抽取。受网络应用驱动,我们分析这样一种设定:奖励是上下文与所选臂当前状态的已知非线性函数。我们首先考虑离散有限上下文空间的情况,并提出 DCB(ϵ\epsilon) 算法,我们通过细致分析证明该算法产生的后悔(相对于感知分布的精灵的累积奖励差距)随时间对数缩放,且与对任何上下文均非最优的臂的数量成线性,改进了现有后悔与臂总数成线性缩放的算法。随后我们研究具有 Lipschitz 奖励函数的连续上下文空间,并提出 CCB(ϵ,δ\epsilon, \delta) 算法,该算法以 DCB(ϵ\epsilon) 为子例程。CCB(ϵ,δ\epsilon, \delta) 揭示了一种由 δ\delta 参数化的新颖后悔-存储权衡。将 δ\delta 调谐至时间视野使我们能够获得次线性后悔界,同时需要次线性存储。通过利用所有上下文的联合学习,我们得到 CCB(ϵ,δ\epsilon, \delta) 的后悔界,这是现有连续上下文空间的上下文赌博机算法无法达到的。我们还展示了未知视野情况下的类似性能界。

关键词

引用

@article{arxiv.1605.00176,
  title  = {Stochastic Contextual Bandits with Known Reward Functions},
  author = {Pranav Sakulkar and Bhaskar Krishnamachari},
  journal= {arXiv preprint arXiv:1605.00176},
  year   = {2016}
}

备注

A version of this technical report is under submission in IEEE/ACM Transactions on Networking