重新思考对抗逆强化学习:策略模仿、可迁移奖励恢复与代数均衡证明
机器学习
2024-10-29 v4 机器学习
摘要
对抗逆强化学习 (AIRL) 是模仿学习中的基石方法,但它在先前研究中受到了批评。在本文中,我们重新思考 AIRL 并对这些批评作出回应。批评1在于策略模仿不充分。我们表明,在策略更新(需要多次迭代)期间用 soft actor-critic (SAC) 替换内置算法可显著提高策略模仿的效率。批评2在于尽管集成了 SAC,可迁移奖励恢复的性能仍受限。我们发现,虽然 SAC 确实在策略模仿上表现出显著改善,但它给可迁移奖励恢复带来了缺陷。我们证明 SAC 算法本身在 AIRL 训练过程中无法全面解耦奖励函数,并提出了一种混合框架 PPO-AIRL + SAC 以获得满意的迁移效果。批评3在于从势均衡视角的证明不令人满意。我们从代数理论视角对其进行了重新分析。
引用
@article{arxiv.2403.14593,
title = {Rethinking Adversarial Inverse Reinforcement Learning: Policy Imitation, Transferable Reward Recovery and Algebraic Equilibrium Proof},
author = {Yangchun Zhang and Qiang Liu and Weiming Li and Yirui Zhou},
journal= {arXiv preprint arXiv:2403.14593},
year = {2024}
}
备注
The content of this paper needs to be thoroughly revised.