中文

面向持续强化学习的多粒度知识迁移

机器学习 2025-06-06 v3 人工智能

摘要

持续强化学习 (CRL) 赋予强化学习智能体学习一系列任务的能力,使其能够积累过去学到的知识,并利用这些知识进行问题求解或未来任务学习。然而,现有方法通常侧重于在相似任务间迁移细粒度知识,忽略了人类认知控制的多粒度结构,导致在多样化任务间知识迁移不足。为了增强粗粒度知识迁移,我们提出了一种名为 MT-Core(面向持续强化学习的多粒度知识迁移的简称)的新型框架。MT-Core 的一个关键特性是多粒度策略学习:1) 一种粗粒度策略制定,利用大语言模型 (LLM) 强大的推理能力来设定目标;2) 一种由目标导向的、通过强化学习进行的细粒度策略学习。我们还构建了一个新的策略库(知识库)来存储可检索用于多粒度知识迁移的策略。实验结果表明,与流行的基线方法相比,所提出的 MT-Core 在处理多样化的持续强化学习任务方面具有优越性。

关键词

引用

@article{arxiv.2401.15098,
  title  = {Multi-granularity Knowledge Transfer for Continual Reinforcement Learning},
  author = {Chaofan Pan and Lingfei Ren and Yihui Feng and Linbo Xiong and Wei Wei and Yonghao Li and Xin Yang},
  journal= {arXiv preprint arXiv:2401.15098},
  year   = {2025}
}

备注

the 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)