基于 Actor-Critic 的不当强化学习
机器学习
2022-07-20 v1 人工智能
系统与控制
系统与控制
摘要
我们考虑一种不当强化学习设定,其中学习者获得针对未知马尔可夫决策过程的 个基控制器,并希望以最优方式将它们组合,产生一个可能全新的、能够超越各个基控制器的控制器。这在跨控制器调优中是有用的,这些控制器可能是在不匹配或模拟环境中学习得到的,从而以较少的试验次数为给定目标环境获得良好控制器。为此,我们提出两种算法:(1)基于策略梯度的方法;(2)一种可根据可用信息在简单 Actor-Critic(AC)基方案和自然 Actor-Critic(NAC)基方案之间切换的算法。两种算法均在给定控制器的不当混合类上运行。对于第一种情况,我们假设可访问梯度预言机并推导收敛速率保证。对于基于 AC 的方法,我们提供了在基本 AC 情况下收敛到驻点、在 NAC 情况下收敛到全局最优的收敛速率保证。在(i)稳定倒立摆这一标准控制理论基准;以及(ii)约束排队任务上的数值结果表明,即便手头的基策略不稳定,我们的不当策略优化算法仍能稳定系统。
引用
@article{arxiv.2207.09090,
title = {Actor-Critic based Improper Reinforcement Learning},
author = {Mohammadi Zaki and Avinash Mohan and Aditya Gopalan and Shie Mannor},
journal= {arXiv preprint arXiv:2207.09090},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2102.08201