IL-SOAR:基于软乐观Actor-Critic的模仿学习
机器学习
2025-06-02 v3
摘要
本文提出了用于模仿学习的SOAR框架。SOAR是一种算法模板,通过专家演示学习策略,采用原始-对偶风格算法交替进行代价更新和策略更新。在策略更新中,SOAR框架使用具有多个评论家的Actor-Critic方法来估计评论家的不确定性,并构建用于驱动探索的乐观评论家。当在表格环境中实例化时,我们得到了一个具有与已知最佳结果在ε意义上匹配的保证的可证明算法。在实践中,SOAR模板被证明能在多个MuJoCo环境中持续提升基于Soft Actor-Critic的模仿学习算法(如f-IRL、ML-IRL和CSIL)的性能。总体而言,得益于SOAR,达到相同性能所需的幕数减少了一半。
引用
@article{arxiv.2502.19859,
title = {IL-SOAR : Imitation Learning with Soft Optimistic Actor cRitic},
author = {Stefano Viel and Luca Viano and Volkan Cevher},
journal= {arXiv preprint arXiv:2502.19859},
year = {2025}
}