中文

具有内生与外生不确定性的环境中强化学习的基本极限

机器学习 2021-06-17 v1 机器学习

摘要

在线强化学习(RL)已广泛应用于信息处理场景,这类场景通常因信道与业务需求的内在随机性而表现出高度不确定性。在本文中,我们考虑一般马尔可夫决策过程(MDPs)中具有内生与外生双重不确定性的无折扣 RL,其中奖励与状态转移概率对 RL 智能体均未知,并随时间演化,只要各自的变异不超过特定动态预算(即上界)。我们首先开发了基于变异感知 Bernstein 的上置信强化学习(VB-UCRL),其允许依据依赖于变异的调度进行重启。我们成功克服了外生不确定性带来的挑战,并确立了相较文献中最新结果至多节省 S\sqrt{S}S16T112S^{\frac{1}{6}}T^{\frac{1}{12}} 的遗憾界,其中 SS 表示 MDP 的状态数,TT 表示学习步数的迭代索引。

关键词

引用

@article{arxiv.2106.08477,
  title  = {Fundamental Limits of Reinforcement Learning in Environment with Endogeneous and Exogeneous Uncertainty},
  author = {Rongpeng Li},
  journal= {arXiv preprint arXiv:2106.08477},
  year   = {2021}
}

备注

Manuscript has been submitted to an IEEE journal. Copyright may be transferred without further notice