分布连续控制中对分位数选择的不敏感性
机器学习
2023-01-02 v1 人工智能
摘要
近年来分布强化学习产生了许多最先进的结果。随着时间推移,针对离散动作域开发的样本效率渐高的分布算法被提出,它们主要区别在于价值分布近似的参数化方式以及量化这些分布之间差异的方法。在这项工作中,我们通过将两种强大的 actor-critic 算法(TD3 和 SAC)扩展以包含分布评论家,将上述三种最知名且成功的算法(QR-DQN、IQN 和 FQF)迁移到连续动作域。我们研究这些算法在离散动作空间中的相对性能是否延续到连续情形。为此,我们在一组连续控制任务的 pybullet 实现上对他们进行经验比较。我们的结果表明,在确定性连续动作设定下,关于分布原子数量与位置存在定性不敏感性。
关键词
引用
@article{arxiv.2212.14262,
title = {Invariance to Quantile Selection in Distributional Continuous Control},
author = {Felix Grün and Muhammad Saif-ur-Rehman and Tobias Glasmachers and Ioannis Iossifidis},
journal= {arXiv preprint arXiv:2212.14262},
year = {2023}
}