中文

面向推荐的边缘兼容强化学习

机器学习 2022-08-11 v2

摘要

大多数为边缘计算设计的强化学习(RL)推荐系统必须在推荐选择期间进行同步,或依赖于无原则的拼凑算法集合。在这项工作中,我们基于异步协同智能体策略梯度算法 \citep{kostas2020asynchronous} 提出了一个解决该问题的有原则方案。我们提出的这类算法可以分布在互联网上,并异步且实时地运行。当给定边缘未能以足够快的速度响应数据请求时,这不是问题;该算法被设计为在边缘环境中运行和学习,网络问题是该环境的一部分。结果是一个有原则的、理论上有依据的 RL 算法,旨在该异步环境中分布并学习。在这项工作中,我们详细描述了该算法和一类所提出的架构,并证明它们即使在网络质量下降时也在异步环境中表现良好。

关键词

引用

@article{arxiv.2112.05812,
  title  = {Edge-Compatible Reinforcement Learning for Recommendations},
  author = {James E. Kostas and Philip S. Thomas and Georgios Theocharous},
  journal= {arXiv preprint arXiv:2112.05812},
  year   = {2022}
}