中文

持续离线强化学习中的策略层次子空间

机器学习 2026-02-06 v4

摘要

我们考虑持续强化学习设置,其中学习代理必须在保持已获取技能集的同时持续适应新的任务,特别关注如何避免忘记过往知识并实现随任务数量增长的可扩展性。这些问题在自主机器人和视频游戏模拟中尤为突出,尤其是那些易受拓扑或运动学变化影响的导航任务。为此,我们引入 HiSPO,一个专为从离线数据进行持续学习而设计的层次框架。该方法利用神经网络的不同策略子空间,以实现对新任务的灵活高效适应,同时保留现有知识。我们通过严谨的实验研究,展示了该方法在经典 MuJoCo 迷宫环境和复杂视频游戏式导航模拟中的有效性,表现出竞争性能和满意的适应性,尤其在内存使用和效率方面。

关键词

引用

@article{arxiv.2412.14865,
  title  = {Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning},
  author = {Anthony Kobanda and Rémy Portelas and Odalric-Ambrym Maillard and Ludovic Denoyer},
  journal= {arXiv preprint arXiv:2412.14865},
  year   = {2026}
}