基于粗到细的连续控制强化学习
机器人学
2024-07-11 v1 人工智能
计算机视觉与模式识别
机器学习
系统与控制
系统与控制
摘要
尽管近期在改进强化学习(RL)算法样本效率方面取得了进展,但设计一种可在真实环境中实际部署的RL算法仍然是一个挑战。本文提出了一种名为粗到细强化学习(Coarse-to-fine Reinforcement Learning, CRL)的框架,通过粗到细的方式训练RL智能体以细化连续动作空间,从而能够在细粒度连续控制任务中运用稳定、高效的基于价值的RL算法。我们的核心思想是训练智能体,通过迭代以下步骤来输出动作:(i) 将连续动作空间离散化为多个区间,(ii) 选择具有最高Q值的区间以进行下一层的进一步离散化。我们随后在CRL框架内引入一种具体的基于价值的算法,称为粗到细Q网络(Coarse-to-fine Q-Network, CQN)。我们的实验表明,在20个稀疏奖励的RLBench操控任务中,CQN以有限的环境交互次数和专家演示,显著优于RL和行为克隆基线。我们还展示了CQN能够在线训练几分钟内稳健地学习解决真实世界的操控任务。
引用
@article{arxiv.2407.07787,
title = {Continuous Control with Coarse-to-fine Reinforcement Learning},
author = {Younggyo Seo and Jafar Uruç and Stephen James},
journal= {arXiv preprint arXiv:2407.07787},
year = {2024}
}
备注
Project webpage: https://younggyo.me/cqn/