非平稳强化学习的复杂度
机器学习
2023-07-14 v1 人工智能
数据结构与算法
机器学习
摘要
强化学习领域中的持续学习问题,常被称为非平稳强化学习,已被认为是强化学习应用面临的一项重要挑战。我们证明了一个最坏情况复杂度结果,相信其刻画了该挑战:在强化学习问题中修改单个状态-动作对的概率或奖励,需要几乎与状态数量相当的时间来保持价值函数更新,除非强指数时间假设(SETH)不成立;SETH 是对 P NP 猜想的广泛接受的强化。须知在当前强化学习应用中状态数量通常天文级庞大。相比之下,我们表明仅仅一个新的状态-动作对则容易实现得多。
引用
@article{arxiv.2307.06877,
title = {The complexity of non-stationary reinforcement learning},
author = {Christos Papadimitriou and Binghui Peng},
journal= {arXiv preprint arXiv:2307.06877},
year = {2023}
}