优化持续 MDP 的长期平均奖励:技术报告
机器学习
2021-04-15 v2 信息论
网络与互联网体系结构
math.IT
摘要
近来,我们通过适当激活传感器以更新其在缓存赋能物联网(IoT)网络中的当前状态,在用户所经历的信息新鲜度(以信息年龄(AoI)衡量)与传感器能耗之间取得了平衡 [1]。为求解该问题,我们将相应状态更新过程建模为持续马尔可夫决策过程(MDP)(即无终止状态),其中状态-动作对数量随所考虑传感器与用户数呈指数增长。此外,为规避维数灾难,我们建立了一种设计深度强化学习(DRL)算法的方法论,以最大化(相应最小化)平均奖励(相应成本),其通过整合 R-learning(一种专为最大化长期平均奖励设计的表格强化学习(RL)算法)与最初为优化折扣长期累积奖励而非平均奖励而开发的传统 DRL 算法实现。本技术报告中,我们将对该方法论的技术贡献进行详细讨论。
引用
@article{arxiv.2104.06139,
title = {Optimizing the Long-Term Average Reward for Continuing MDPs: A Technical Report},
author = {Chao Xu and Yiping Xie and Xijun Wang and Howard H. Yang and Dusit Niyato and Tony Q. S. Quek},
journal= {arXiv preprint arXiv:2104.06139},
year = {2021}
}