中文

基于不完美在线示范的守护策略优化

机器学习 2023-04-25 v2 人工智能 机器人学

摘要

师生框架(TSF)是一种强化学习设定,其中教师智能体通过干预并提供在线示范来守护学生智能体的训练。假设教师策略是最优的,则其具备干预学生智能体学习过程的完美时机与能力,提供安全保证与探索引导。然而,在许多现实设定中,获得表现良好的教师策略是昂贵甚至不可能的。在本工作中,我们放宽对表现良好教师的假设,并开发一种能够融入具有中等或较差表现的任意教师策略的新方法。我们实例化了一种离策略强化学习算法,称为师生共享控制(TS2C),其基于基于轨迹的值估计来融入教师干预。理论分析验证,所提出的 TS2C 算法实现了高效探索与实质安全保证,且不受教师自身表现的影响。在各种连续控制任务上的实验表明,我们的方法能够利用不同表现水平的教师策略,同时保持较低的训练成本。此外,在留出的测试环境中,学生策略在更高的累积奖励方面超越了不完美的教师策略。代码见 https://metadriverse.github.io/TS2C。

关键词

引用

@article{arxiv.2303.01728,
  title  = {Guarded Policy Optimization with Imperfect Online Demonstrations},
  author = {Zhenghai Xue and Zhenghao Peng and Quanyi Li and Zhihan Liu and Bolei Zhou},
  journal= {arXiv preprint arXiv:2303.01728},
  year   = {2023}
}

备注

Accepted at ICLR 2023 (top 25%)