无线网络中的关联问题:一种策略梯度强化学习方法
网络与互联网体系结构
2013-06-12 v1 信息论
机器学习
math.IT
摘要
本文旨在开发一种基于 PGRL(策略梯度强化学习)的自优化关联算法,该算法兼具可扩展性、稳定性和鲁棒性。术语“鲁棒性”意味着学习阶段的性能下降应被禁止或限制在预定义的阈值内。该算法是无模型的(与值迭代相反)且鲁棒的(与 Q-Learning 相反)。关联问题被建模为马尔可夫决策过程(MDP)。策略空间被参数化。参数化的策略族随后被用作 PGRL 的专家知识。PGRL 收敛于局部最优解,且平均成本在学习过程中单调递减。解的性质使其成为实际实施的良好候选者。此外,鲁棒性特性允许在“始终在线”的学习模式下使用 PGRL 算法。
引用
@article{arxiv.1306.2554,
title = {The association problem in wireless networks: a Policy Gradient Reinforcement Learning approach},
author = {Richard Combes and Ilham El Bouloumi and Stephane Senecal and Zwi Altman},
journal= {arXiv preprint arXiv:1306.2554},
year = {2013}
}
备注
Working version