中文

利用决策Transformer求解持续离线强化学习

机器学习 2024-04-09 v2 人工智能

摘要

持续离线强化学习(CORL)结合了持续学习与离线强化学习,使智能体能够从静态数据集中学习多个任务而不遗忘先前任务。然而,CORL在平衡稳定性与可塑性方面面临挑战。现有方法采用Actor-Critic结构和经验回放(ER),存在分布偏移、效率低下和知识共享薄弱等问题。我们旨在探究另一种离线强化学习范式——决策Transformer(Decision Transformer, DT)——是否可以作为更合适的离线持续学习器来解决这些问题。我们首先在CORL框架下比较了基于AC的离线算法与DT。DT在学习效率、缓解分布偏移和零样本泛化方面具有优势,但在有监督参数更新过程中加剧了遗忘问题。我们引入多头DT(MH-DT)和低秩适应DT(LoRA-DT)来缓解DT的遗忘问题。MH-DT使用多个头存储任务特定知识,通过共享通用组件促进知识共享。当有回放缓冲区可用时,它采用蒸馏和选择性复述来增强当前任务学习。在无缓冲区场景下,LoRA-DT合并影响较小的权重并微调DT的关键MLP层以适应当前任务。在MoJuCo和Meta-World基准上的大量实验表明,我们的方法优于SOTA CORL基线,并展现出增强的学习能力和优越的记忆效率。

关键词

引用

@article{arxiv.2401.08478,
  title  = {Solving Continual Offline Reinforcement Learning with Decision Transformer},
  author = {Kaixin Huang and Li Shen and Chen Zhao and Chun Yuan and Dacheng Tao},
  journal= {arXiv preprint arXiv:2401.08478},
  year   = {2024}
}

备注

11 pages, 6 figures