中文

将缓存替换建模为具有延迟反馈与衰减成本的多臂老虎机问题

机器学习 2021-05-20 v4 机器学习

摘要

受缓存替换问题启发,我们提出并求解了著名的多臂老虎机(MAB)的一个新变体,从而为由此改进现有最先进的缓存管理方法提供方案。每支臂(或专家)代表一种不同的缓存替换策略,在需要时就驱逐缓存中的哪一页给出建议。关于驱逐的反馈以“未命中”形式出现,但发生在动作执行后的不确定时刻,且驱逐成本设定为与响应时间成反比。若反馈在延迟阈值之后到来,则被忽略,我们将该阈值设为等于页驱逐历史的大小。因此,对于超过阈值的延迟,其成本被假定为零。我们遂将这一问题称为具有延迟反馈与衰减成本的问题。我们引入了一种自适应强化学习算法 EXP4-DFDC 来提供该问题的解。我们推导了 EXP4-DFDC 的最优学习率,其界定了探索与利用之间的平衡,并从理论上证明我们算法的期望后悔量作为时间的函数是一个趋于消失的量。作为一个应用,我们展示了近期性能顶尖的缓存替换机器学习算法 LeCaR 可利用我们的公式通过自适应学习得到增强。我们给出了 LeCaR 的改进自适应版本,称为 OLeCaR,其学习率按此处理论推导所确定的值设定,以最小化 EXP4-DFDC 的后悔。由此可知,LeCaR 与 OLeCaR 在理论上随时间具有消失的后悔保证。

关键词

引用

@article{arxiv.2009.11330,
  title  = {Cache Replacement as a MAB with Delayed Feedback and Decaying Costs},
  author = {Farzana Beente Yusuf and Vitalii Stebliankin and Giuseppe Vietri and Giri Narasimhan},
  journal= {arXiv preprint arXiv:2009.11330},
  year   = {2021}
}