超越单模型优化:在持续强化学习中保持可塑性
机器学习
2026-04-20 v1 人工智能
神经与进化计算
摘要
持续强化学习必须平衡保留与适应,然而许多方法仍然依赖于单模型保留,即致力于将一种不断演化的策略作为跨任务的主要可重用解决方案。即使保留了先前成功的策略,在受到干扰后,它可能不再为快速适应提供可靠的起点,这反映了一种单策略保留无法解决的可塑性丧失。受质量-多样性(quality-diversity)方法的启发,我们提出了 TeLAPA(Transfer-Enabled Latent-Aligned Policy Archives,支持迁移的潜在对齐策略档案),这是一个持续强化学习框架,它将行为多样的策略邻域组织到每个任务的档案中,并维护一个共享的潜在空间,使得存档的策略在非平稳漂移下保持可比较和可重用。这一视角将持续强化学习从保留孤立的解决方案转变为维护技能对齐的邻域,其中包含支持未来重新学习的、有能力且行为相关的策略。在我们的 MiniGrid 持续学习设置中,TeLAPA 成功学习了更多任务,在受到干扰后重新访问任务时更快地恢复能力,并在任务序列中保持了更高的性能。我们的分析表明,源最优策略通常不是迁移最优的,即使在局部有能力邻域内也是如此,并且有效的重用依赖于保留和选择多个邻近的替代方案,而不是将它们坍缩为一个代表。这些结果共同将持续强化学习重新定义为围绕可重用和有能力的策略邻域,为超越单模型保留、迈向更具可塑性的终身智能体提供了一条途径。
引用
@article{arxiv.2604.15414,
title = {Beyond Single-Model Optimization: Preserving Plasticity in Continual Reinforcement Learning},
author = {Lute Lillo and Nick Cheney},
journal= {arXiv preprint arXiv:2604.15414},
year = {2026}
}