基于在线世界模型的持续强化学习
机器学习
2025-07-15 v1 人工智能
机器学习
摘要
持续强化学习 (CRL) 指的是一个主体需要通过反复试验,不断进化以解决顺序呈现的多个任务的自然场景。一个最大障碍是该主体在学习新任务时,可能会忘记如何解决以前的任务,称为灾难性遗忘。本文提出通过基于在线世界模型的规划来解决这一挑战。具体而言,我们在线学习一个跟随者模型 (Follow-The-Leader) 来捕捉世界动态,其中我们使用模型预测控制来解决由任意奖励函数指定的一组任务。该在线世界模型通过构造方式免疫于遗忘,under mild assumptions 下被证明具有 的 regret bound。规划器仅基于最新的在线模型搜索动作,从而形成一个 FTL 在线主体 (OA),该主体增量更新。为评估 OA,我们进一步设计了持续基准 (Continual Bench),用于 CRL 的专门环境,并在相同的模型-规划算法框架下与几个强基线进行比较。实验结果表明,OA 在不忘记旧技能的同时,不断学习以解决新任务,超越了基于各种持续学习技术的深层世界模型构建的主体。
引用
@article{arxiv.2507.09177,
title = {Continual Reinforcement Learning by Planning with Online World Models},
author = {Zichen Liu and Guoji Fu and Chao Du and Wee Sun Lee and Min Lin},
journal= {arXiv preprint arXiv:2507.09177},
year = {2025}
}
备注
ICML 2025 Spotlight