ARC——用于对抗模仿学习的动作残差评论家
机器学习
2022-12-01 v4 机器人学
摘要
对抗模仿学习(AIL)是一类流行的顶尖模仿学习算法,常用于机器人学。在AIL中,人工对抗者的误分类被用作奖励信号,由任何标准强化学习(RL)算法优化。与多数RL设定不同,AIL中的奖励是可微的,但当前无模型RL算法未利用此性质训练策略。AIL中的奖励亦因来自对抗者而呈塑形。我们利用塑形AIL奖励函数的可微性,提出一类动作残差评论家(ARC)RL算法。ARC算法与RL文献中标准行动者-评论家(AC)算法相平行,并使用残差评论家,即函数(而非标准函数)仅近似折扣未来回报(不含即时奖励)。ARC算法具有与标准AC算法相似的收敛性质,且额外优势在于通过即时奖励的梯度是精确的。对于具有有限状态、动作与已知动态的离散(表格)情形,我们证明带函数的策略迭代收敛至最优策略。在具函数近似与未知动态的连续情形中,我们通过实验表明ARC辅助的AIL在模拟连续控制与真实机器人操纵任务中优于标准AIL。ARC算法实现简单,可融入任何现有带AC算法的AIL实现中。视频与代码链接见:https://sites.google.com/view/actor-residual-critic。
引用
@article{arxiv.2206.02095,
title = {ARC - Actor Residual Critic for Adversarial Imitation Learning},
author = {Ankur Deka and Changliu Liu and Katia Sycara},
journal= {arXiv preprint arXiv:2206.02095},
year = {2022}
}