中文

存在外生信息时的样本高效强化学习

机器学习 2022-06-10 v1

摘要

在真实世界的强化学习应用中,学习者的观测空间普遍是高维的,包含关于当前任务的相关与无关信息。从高维观测中学习已在监督学习和统计学中受到广泛研究(例如通过稀疏性),但强化学习中的类似问题即使在有限状态/动作(表格)域中也未被很好理解。我们引入了一种新的强化学习问题设定,即外生马尔可夫决策过程(ExoMDP),其中状态空间容许一个(未知的)分解为一个小的可控(或内生的)分量和一个大的无关(或外生的)分量;外生分量独立于学习者的动作,但以任意的、时间相关的方式演化。我们提供了一种新算法 ExoRL,它以关于内生成分大小的多项式样本复杂度和几乎独立于外生成分大小的样本复杂度学习到近最优策略,从而相比现成算法实现了双重指数级的改进。我们的结果首次强调,在外生信息存在的情况下样本高效的强化学习是可能的,并为今后的研究提供了一个简单、用户友好的基准。

关键词

引用

@article{arxiv.2206.04282,
  title  = {Sample-Efficient Reinforcement Learning in the Presence of Exogenous Information},
  author = {Yonathan Efroni and Dylan J. Foster and Dipendra Misra and Akshay Krishnamurthy and John Langford},
  journal= {arXiv preprint arXiv:2206.04282},
  year   = {2022}
}

备注

Accepted for presentation at the Conference on Learning Theory (COLT) 2022