中文

通过自适应策略自组合进行持续任务学习

机器学习 2024-11-19 v1 人工智能

摘要

训练一个可泛化的智能体从离线轨迹中持续学习一系列任务,是对长寿命智能体的自然要求,但这对当前的离线强化学习(RL)算法仍然是一个重大挑战。具体而言,智能体必须能够使用新收集的轨迹快速适应新任务(可塑性),同时保留从先前学习的任务中获得的知识(稳定性)。然而,对此设置的系统性分析很少,且传统持续学习(CL)方法在持续离线强化学习(CORL)场景中是否有效仍不清楚。在本研究中,我们开发了 Offline Continual World 基准,并证明传统的 CL 方法难以应对灾难性遗忘,这主要是由于 CORL 场景固有的独特分布偏移。为了应对这一挑战,我们引入了 CompoFormer,这是一种基于结构的持续 Transformer 模型,它通过元策略网络自适应地组合先前的策略。在遇到新任务时,CompoFormer 利用语义相关性,将相关的先前策略与新训练的参数选择性集成,从而增强知识共享并加速学习过程。我们的实验表明,CompoFormer 优于传统的 CL 方法,特别是在更长的任务序列中,展示了可塑性与稳定性之间极具前景的平衡。

关键词

引用

@article{arxiv.2411.11364,
  title  = {Continual Task Learning through Adaptive Policy Self-Composition},
  author = {Shengchao Hu and Yuhang Zhou and Ziqing Fan and Jifeng Hu and Li Shen and Ya Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2411.11364},
  year   = {2024}
}

备注

21 pages, 8 figures