面向快速策略迁移的相对策略-转移优化
机器学习
2024-01-25 v3 人工智能
摘要
我们考虑两个马尔可夫决策过程(MDP)之间的策略迁移问题。基于强化学习中已有的理论结果,我们引入一个引理来度量任意两个 MDP 之间的相对性差距,即定义在不同策略与环境动态上的任意两个累积期望回报之差。基于该引理,我们提出两种新算法,分别称为相对策略优化(RPO)与相对转移优化(RTO),它们分别提供快速的策略迁移与动态建模。RPO 将在一个环境中评估的策略迁移以最大化另一环境中的回报,而 RTO 更新参数化动态模型以缩小两环境动态之间的差距。将两种算法结合得到完整的相对策略-转移优化(RPTO)算法,其中策略同时与两个环境交互,使得来自两个环境的数据收集、策略与转移更新在一个闭环中完成,从而形成用于策略迁移的原则性学习框架。我们通过在 MuJoCo 连续控制任务上构建变动态的策略迁移问题,展示了 RPTO 的有效性。
引用
@article{arxiv.2206.06009,
title = {Relative Policy-Transition Optimization for Fast Policy Transfer},
author = {Jiawei Xu and Cheng Zhou and Yizheng Zhang and Baoxiang Wang and Lei Han},
journal= {arXiv preprint arXiv:2206.06009},
year = {2024}
}
备注
Accepted by AAAI 2024