中文

基于能量的强化学习迁移方法

机器学习 2025-06-23 v1 人工智能

摘要

强化学习算法常因样本效率低下,在多任务或持续学习场景中难以应用。通过将已训练的教师策略知识迁移以引导新任务中的探索,可提高效率。然而,当新任务与教师训练任务差异较大时,迁移的指导可能次优,导致探索偏向低奖励行为。我们提出一种基于能量的迁移学习方法,利用离分布检测 selectively 发出指导,使教师仅在其训练分布内的状态中干预。我们理论证明,能量分数反映了教师的状态访问密度,并通过实验在单任务和多任务设置中展示了更好的样本效率和性能。

关键词

引用

@article{arxiv.2506.16590,
  title  = {Energy-Based Transfer for Reinforcement Learning},
  author = {Zeyun Deng and Jasorsi Ghosh and Fiona Xie and Yuzhe Lu and Katia Sycara and Joseph Campbell},
  journal= {arXiv preprint arXiv:2506.16590},
  year   = {2025}
}