ACERAC:细时间离散下的高效强化学习
机器学习
2022-07-12 v4
摘要
强化学习(RL)的主要目标之一是为物理机器提供一种学习最优行为而非被编程的途径。然而,对机器的有效控制通常需要细时间离散。最常见的RL方法对每个动作施加独立的随机元素,在该设定下并不适用。这不可行,因为它导致被控系统抖动,且无法确保充分探索,因为单个动作时长不足以产生可转化为策略改进的重要经验。我们认为这些是阻碍RL在当代控制系统中应用的主要障碍。为解决这些缺陷,本文引入一种RL框架及适用于后续时间实例中可能随机相关动作的分析工具。我们还引入一种RL算法,近似优化产生此类动作的策略。它应用经验回放来调整先前动作序列的似然,以优化策略产生的期望步回报。该算法的效率在四种模拟学习控制问题(Ant、HalfCheetah、Hopper与Walker2D)及不同时间离散下,对照其他四种RL方法(CDAU、PPO、SAC、ACER)进行了验证。本文引入的算法在多数考虑情形下优于竞争者。
引用
@article{arxiv.2104.04004,
title = {ACERAC: Efficient reinforcement learning in fine time discretization},
author = {Jakub Łyskawa and Paweł Wawrzyński},
journal= {arXiv preprint arXiv:2104.04004},
year = {2022}
}
备注
Submitted to IEEE Transactions on Neural Networks and Learning Systems. arXiv admin note: text overlap with arXiv:2009.04777