HyAR:通过混合动作表示解决离散-连续动作强化学习
机器学习
2022-03-17 v3 人工智能
摘要
离散-连续混合动作空间是许多实际问题(如机器人控制和游戏AI)中的自然设定。然而,以往大多数强化学习(RL)工作仅展示了在离散或连续动作空间控制上的成功,很少考虑混合动作空间。解决混合动作RL的一种朴素方法是通过离散化或连续化将混合动作空间转换为统一同质动作空间,从而可应用常规RL算法。但这忽略了混合动作空间的底层结构,并引发可扩展性问题与额外近似困难,导致性能退化。本文中,我们提出混合动作表示(HyAR)来为原始混合动作空间学习一个紧凑且可解码的潜在表示空间。HyAR通过嵌入表和条件变分自编码器(VAE)构建潜在空间并嵌入离散动作与连续参数间的依赖关系。为进一步提升有效性,该动作表示通过无监督环境动态预测被训练为语义平滑的。最终,智能体在所学表示空间中使用常规DRL算法学习其策略,并通过将混合动作嵌入解码回原始动作空间与环境交互。我们在多种具有离散-连续动作空间的环境中评估HyAR。结果证明了HyAR相较于先前基线的优越性,尤其在高维动作空间下。
引用
@article{arxiv.2109.05490,
title = {HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation},
author = {Boyan Li and Hongyao Tang and Yan Zheng and Jianye Hao and Pengyi Li and Zhen Wang and Zhaopeng Meng and Li Wang},
journal= {arXiv preprint arXiv:2109.05490},
year = {2022}
}
备注
Accepted on ICLR 2022