基于对称先验的深度强化学习预测性移动用户功率分配
网络与互联网体系结构
2021-03-25 v1 机器学习
摘要
深度强化学习已应用于多种无线任务,但其训练与推理复杂度高为人所知。本文中,我们借助深度确定性策略梯度(DDPG)算法来优化请求视频流的K个移动用户间的预测性功率分配,以在各用户无卡顿约束下最小化网络能耗。为降低DDPG的采样复杂度与模型规模,我们利用 actor 与 critic 网络中固有的一种对称先验:置换不变与等变性质,来设计神经网络。我们的分析表明,DDPG的自由模型参数可被压缩 2/K^2。仿真结果表明,当 K = 10 时,带对称先验的学习模型达到与原始策略相同性能所需的训练轮次减少约三分之一。
引用
@article{arxiv.2103.13298,
title = {Deep Reinforcement Learning with Symmetric Prior for Predictive Power Allocation to Mobile Users},
author = {Jianyu Zhao and Chenyang Yang},
journal= {arXiv preprint arXiv:2103.13298},
year = {2021}
}