中文

IOB:面向多策略复用的优化迁移与行为迁移集成方法

机器学习 2023-08-16 v1 人工智能

摘要

人类具备复用已学策略以快速解决新任务的能力,强化学习(RL)智能体同样可通过从源策略向相关目标任务迁移知识来实现这一点。迁移 RL 方法可利用源策略重塑策略优化目标(优化迁移)或影响行为策略(行为迁移)。然而,在有限样本下选择合适的源策略以引导目标策略学习一直是一项挑战。先前方法引入额外组件,如分层策略或源策略价值函数估计,这可能导致非平稳策略优化或高昂采样成本,削弱迁移效果。为应对该挑战,我们提出一种新颖的迁移 RL 方法,可在无需训练额外组件的情况下选择源策略。我们的方法利用 actor-critic 框架中的 Q 函数来引导策略选择,选取相对当前目标策略具有最大单步改进者作为源策略。我们通过正则化所学策略以模仿引导策略,并将其组合作为行为策略,从而集成优化迁移与行为迁移(IOB)。该集成显著增强了迁移效果,在基准任务中超越最先进的迁移 RL 基线,并在持续学习场景中提升最终性能与知识可迁移性。此外,我们证明了我们的优化迁移技术可保证改进目标策略学习。

关键词

引用

@article{arxiv.2308.07351,
  title  = {IOB: Integrating Optimization Transfer and Behavior Transfer for Multi-Policy Reuse},
  author = {Siyuan Li and Hao Li and Jin Zhang and Zhen Wang and Peng Liu and Chongjie Zhang},
  journal= {arXiv preprint arXiv:2308.07351},
  year   = {2023}
}

备注

26 pages, 9 figures