已知奖励函数的随机上下文赌博机
机器学习
2016-05-10 v2
摘要
通信网络中的许多序贯决策问题可建模为上下文赌博机问题,它们是著名的多臂赌博机问题的自然扩展。在上下文赌博机问题中,每时刻一个智能体观测到某些边信息或上下文,拉动一个臂并接收该臂的奖励。我们考虑一种随机表述,其中上下文-奖励元组在每次试验时独立地从未知分布抽取。受网络应用驱动,我们分析这样一种设定:奖励是上下文与所选臂当前状态的已知非线性函数。我们首先考虑离散有限上下文空间的情况,并提出 DCB() 算法,我们通过细致分析证明该算法产生的后悔(相对于感知分布的精灵的累积奖励差距)随时间对数缩放,且与对任何上下文均非最优的臂的数量成线性,改进了现有后悔与臂总数成线性缩放的算法。随后我们研究具有 Lipschitz 奖励函数的连续上下文空间,并提出 CCB() 算法,该算法以 DCB() 为子例程。CCB() 揭示了一种由 参数化的新颖后悔-存储权衡。将 调谐至时间视野使我们能够获得次线性后悔界,同时需要次线性存储。通过利用所有上下文的联合学习,我们得到 CCB() 的后悔界,这是现有连续上下文空间的上下文赌博机算法无法达到的。我们还展示了未知视野情况下的类似性能界。
引用
@article{arxiv.1605.00176,
title = {Stochastic Contextual Bandits with Known Reward Functions},
author = {Pranav Sakulkar and Bhaskar Krishnamachari},
journal= {arXiv preprint arXiv:1605.00176},
year = {2016}
}
备注
A version of this technical report is under submission in IEEE/ACM Transactions on Networking