利用专家自举加速逆强化学习
机器学习
2024-02-06 v1
摘要
现有的逆强化学习方法(例如 MaxEntIRL、-IRL)在候选奖励函数空间进行搜索,并在内循环中求解一个强化学习问题。这造成了一种奇怪的倒置:一个更难的问题(强化学习)位于一个据称更容易的问题(模仿学习)的内循环中。在这项工作中,我们表明更好地利用专家演示可以减少内层 RL 循环中对困难探索的需求,从而加速学习。具体而言,我们提出了两个简单的策略:(1) 将专家转移放入内层 RL 算法(例如 Soft-Actor Critic)的重放缓冲区中,直接告知学习者高奖励状态,而不是迫使学习者通过大量探索去发现它们;(2) 在 Q 值自举中使用专家动作,以改进目标 Q 值估计并更准确地描述高价值专家状态。我们的方法在 MuJoCo 基准任务套件上显示出相对于 MaxEntIRL 基线的显著增益,在 HalfCheetah-v2 上将恢复至确定性专家性能 70\% 的速度加快了 2.13 倍,在 Ant-v2 上加快 2.6 倍,在 Hopper-v2 上加快 18 倍,在 Walker2d-v2 上加快 3.36 倍。
引用
@article{arxiv.2402.02608,
title = {Accelerating Inverse Reinforcement Learning with Expert Bootstrapping},
author = {David Wu and Sanjiban Choudhury},
journal= {arXiv preprint arXiv:2402.02608},
year = {2024}
}