基于持续动作的变时间离散化 Actor-Critic 方法
人工智能
2023-08-09 v1
摘要
强化学习(RL)方法在离散时间下工作。为将 RL 应用于如机器人控制等固有连续问题,需定义特定的时间离散化。这是在可能更易训练的稀疏时间控制与可能带来更优最终性能的精细时间控制之间的一种抉择。本工作中,我们提出 SusACER,一种结合不同时间离散化设置优势的非策略 RL 算法。起初它以稀疏时间离散化运行,并逐步切换至精细离散化。我们分析了机器人控制环境(Ant、HalfCheetah、Hopper 与 Walker2D)中变化时间离散化的影响。在所有案例中,我们提出的算法均优于当前最优(SOTA)。
引用
@article{arxiv.2308.04299,
title = {Actor-Critic with variable time discretization via sustained actions},
author = {Jakub Łyskawa and Paweł Wawrzyński},
journal= {arXiv preprint arXiv:2308.04299},
year = {2023}
}