重新思考持续强化学习的基础
机器学习
2025-07-16 v3 人工智能
摘要
在传统强化学习观点中,智能体的目标是找到最大化其预期奖励总和的最优策略。一旦智能体找到这个策略,学习就结束了。这一观点与持续强化学习相对,其中学习不会结束,智能体需要不断学习和适应。尽管持续强化学习与传统学习范式之间存在明显区别,但持续强化学习的大量进展仍受传统强化学习基础的支配。本文首先我们检讨了传统强化学习的基础是否适用于持续强化学习范式。我们识别出四个传统强化学习基础与持续学习目标相矛盾的关键支柱:马尔可夫决策过程形式化、对时间无关性制品的关注、将预期奖励总和作为评估指标,以及拥抱其他三个基础的episodic benchmark 环境。随后,我们提出了新的形式化,摆脱第一个和第三个基础,取而代之的是历史过程作为数学形式化,以及为持续学习所适应的新的偏差后悔定义,作为评估指标。最后,我们讨论了可能的解决其他两个基础的方法。
引用
@article{arxiv.2504.08161,
title = {Rethinking the Foundations for Continual Reinforcement Learning},
author = {Esraa Elelimy and David Szepesvari and Martha White and Michael Bowling},
journal= {arXiv preprint arXiv:2504.08161},
year = {2025}
}