中文

无线系统中最优各态历经策略的无模型学习

系统与控制 2020-12-02 v1 机器学习 系统与控制 信号处理 最优化与控制 机器学习

摘要

在无线系统中学习最优资源分配策略,可通过构建依赖于系统配置以及所采用学习参数化的有限维约束规划来有效实现。这里的关注点在于系统模型不可用的情况,这促使人们采用以候选策略探测无线系统、然后利用观测性能来确定更优策略的方法。这一通用过程十分困难,因为需要从这些有限的系统查询中剔除准确的梯度估计。本文构建并利用了约束各态历经资源分配问题的平滑代理问题,其梯度可精确表示为可通过有限系统探测获得的有限差分的平均值。利用这一独特性质,我们开发了一种用于学习最优各态历经资源分配的新无模型原始对偶算法,同时严格分析了原始策略搜索问题与其代理问题在原始域和对偶域中的关系。首先,我们证明原始域和对偶域代理问题都是其相应原始有限维对应问题的均匀一致逼近。在进一步假设使用近通用策略参数化的情况下,我们还推导了初始无限维资源分配问题的最优值与其参数化平滑代理的对偶值之间差距的显式界。事实上,我们证明该对偶间隙相对于平滑和通用性参数以线性速率减小。因此,它可以任意小,这也证明了我们所提出的原始对偶算法方案。数值仿真证实了我们的方法的有效性。

关键词

引用

@article{arxiv.1911.03988,
  title  = {Model-Free Learning of Optimal Ergodic Policies in Wireless Systems},
  author = {Dionysios S. Kalogerias and Mark Eisen and George J. Pappas and Alejandro Ribeiro},
  journal= {arXiv preprint arXiv:1911.03988},
  year   = {2020}
}

备注

13 pages, 4 figures