中文

通过动作空间探索实现无线系统中最优确定性资源分配的无模型学习

系统与控制 2021-09-28 v2 机器学习 系统与控制

摘要

无线系统资源分配指的是长期且具有挑战性的非凸约束优化任务,这在涉及多个具有异构目标以及不精确甚至未知模型和/或信道统计特性的用户的现代通信与网络设置中尤为及时。在本文中,我们提出了一种技术上有依据且可扩展的原始-对偶确定性策略梯度方法,用于高效学习最优参数化资源分配策略。我们的方法不仅有效利用了流行通用策略表示(如深度神经网络)的梯度可用性,而且是真正的无模型方法,因为它依赖于通过动作空间中的低维扰动构建的相关随机网络服务的一致零阶梯度近似,从而完全绕开了对评价器的任何依赖。理论和数值模拟都证实了所提出方法的有效性和适用性,以及在实现接近最优性能和可扩展性方面相对于当前最先进方法的优越性。

关键词

引用

@article{arxiv.2108.10352,
  title  = {Model-Free Learning of Optimal Deterministic Resource Allocations in Wireless Systems via Action-Space Exploration},
  author = {Hassaan Hashmi and Dionysios S. Kalogerias},
  journal= {arXiv preprint arXiv:2108.10352},
  year   = {2021}
}

备注

6 pages, 4 figures