面向持续学习的块上下文 MDP
机器学习
2021-10-15 v1 人工智能
摘要
在强化学习(RL)中,定义马尔可夫决策过程(MDP)时隐式假设环境动态是平稳的。这一平稳性假设虽简化问题,但在许多场景中并不现实。在持续强化学习场景中,任务序列是另一非平稳性来源。本工作中,我们提议通过块上下文 MDP(BC-MDP)框架来考察此持续强化学习设定,其使我们能够放宽平稳性假设。该框架向 RL 算法提出处理非平稳性与丰富观测设定的挑战,并通过进一步利用平滑性性质,使我们能够研究该设定下的泛化界。最后,我们从自适应控制获得启发,提出一种新算法,应对这一更现实的 BC-MDP 设定带来的挑战,允许在评估时零样本适应,并在多个非平稳环境中取得强劲表现。
引用
@article{arxiv.2110.06972,
title = {Block Contextual MDPs for Continual Learning},
author = {Shagun Sodhani and Franziska Meier and Joelle Pineau and Amy Zhang},
journal= {arXiv preprint arXiv:2110.06972},
year = {2021}
}
备注
26pages, Under Review