中文

基于学习自动机的协作缓存内容放置 Q-learning 方法

信号处理 2019-04-02 v2

摘要

本文构建了协作缓存中内容放置的优化问题,旨在最大化移动用户的平均意见得分(MOS)之和。首先,采用基于监督前馈反向传播连接模型的人工神经网络(SFBC-NN)进行用户移动性与内容流行度预测。更具体地,利用智能手机上 GPS 追踪应用收集的实际数据来验证移动性预测的准确性。随后,提出一种用于协作缓存的基于学习自动机的 Q-learning(LAQL)算法,其中引入学习自动机(LA)进行 Q-learning,以在随机且平稳的环境中获得最优动作选择。证明若 Q-learning 最终能收敛到最优 Q 值,则基于 LA 的动作选择方案能够使每个状态以任意高概率选择最优动作。为刻画所提算法性能,采用用户 MOS 之和定义奖励函数。大量仿真表明:1)SFBC-NN 的预测误差随迭代次数与节点数增加而减小;2)所提 LAQL 相较传统 Q-learning 取得显著性能提升;3)协作缓存方案优于非协作缓存与随机缓存,分别高出 3% 与 4%。

关键词

引用

@article{arxiv.1903.06235,
  title  = {Learning Automata Based Q-learning for Content Placement in Cooperative Caching},
  author = {Zhong Yang and Yuanwei Liu and Yue Chen and Lei Jiao},
  journal= {arXiv preprint arXiv:1903.06235},
  year   = {2019}
}

备注

30 pages, 10 figures