中文

非平稳强化学习的复杂度

机器学习 2023-07-14 v1 人工智能 数据结构与算法 机器学习

摘要

强化学习领域中的持续学习问题,常被称为非平稳强化学习,已被认为是强化学习应用面临的一项重要挑战。我们证明了一个最坏情况复杂度结果,相信其刻画了该挑战:在强化学习问题中修改单个状态-动作对的概率或奖励,需要几乎与状态数量相当的时间来保持价值函数更新,除非强指数时间假设(SETH)不成立;SETH 是对 P \neq NP 猜想的广泛接受的强化。须知在当前强化学习应用中状态数量通常天文级庞大。相比之下,我们表明仅仅添加\textit{添加}一个新的状态-动作对则容易实现得多。

关键词

引用

@article{arxiv.2307.06877,
  title  = {The complexity of non-stationary reinforcement learning},
  author = {Christos Papadimitriou and Binghui Peng},
  journal= {arXiv preprint arXiv:2307.06877},
  year   = {2023}
}