用于干扰信道中无模型功率分配的渐隐经验信任域策略优化
信息论
2020-08-05 v1 机器学习
math.IT
摘要
策略梯度强化学习技术使智能体能够通过与环境交互直接学习最优动作策略。然而,尽管有其优势,它有时面临收敛速度慢的问题。受人类决策方式启发,我们通过增强智能体以记忆并利用近期学到的策略,致力于提升其收敛速度。我们将该方法应用于主要为运动控制任务开发的信任域策略优化(TRPO),并提出渐隐经验(FE)TRPO。为证实其有效性,我们采用它在仅可获得设备含噪位置信息时,学习干扰信道中的连续功率控制。结果表明,与 TRPO 相比,使用 FE-TRPO 可将学习速度提升近一倍。重要的是,我们的方法既不增加学习复杂度,也不造成性能损失。
引用
@article{arxiv.2008.01705,
title = {Faded-Experience Trust Region Policy Optimization for Model-Free Power Allocation in Interference Channel},
author = {Mohammad G. Khoshkholgh and Halim Yanikomeroglu},
journal= {arXiv preprint arXiv:2008.01705},
year = {2020}
}