通过对齐空间上的选择性权重激活解决持续离线强化学习
机器学习
2024-10-22 v1
摘要
持续离线强化学习(CORL)在基于扩散的终身学习系统中通过建模轨迹的联合分布展现了显著的能力。然而,大多数研究仅关注有限的持续任务设置,即这些任务的观察空间和动作空间相同,这与在各种环境中训练智能体的现实需求相背离。鉴于此,我们提出了一种名为 VQ-CD(Vector-Quantized Continual Diffuser)的向量量化持续扩散器,以打破不同任务之间空间差异的障碍。具体而言,我们的方法包含两个互补的模块,其中量化空间的对齐为选择性权重激活提供了统一的基础。在量化空间对齐中,我们利用向量量化对齐各种任务的不同状态和动作空间,以促进同一空间内的持续训练。随后,我们提出采用附带逆动态模型的统一扩散模型,通过根据任务相关的稀疏掩码有选择地激活不同权重来掌握所有任务。最后,我们在15个持续学习(CL)任务上进行了大量实验,包括常规CL任务设置(相同的状态和动作空间)和通用CL任务设置(不同的状态和动作空间)。与16个基线方法相比,我们的方法达到了SOTA性能。
引用
@article{arxiv.2410.15698,
title = {Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces},
author = {Jifeng Hu and Sili Huang and Li Shen and Zhejian Yang and Shengchao Hu and Shisong Tang and Hechang Chen and Yi Chang and Dacheng Tao and Lichao Sun},
journal= {arXiv preprint arXiv:2410.15698},
year = {2024}
}