中文

复合 Q-learning:多尺度 Q 函数分解与可分离优化

机器学习 2020-08-17 v2 人工智能 机器学习

摘要

在过去几年中,离策略强化学习方法在机器人控制应用中展现了有前景的结果。然而,深度 Q-learning 仍存在数据效率低下的问题,且易受环境或奖励函数随机性影响,这限制了其在现实世界中的应用。我们通过提出两种新颖的离策略时序差分(Temporal-Difference)公式来缓解这些问题:(1)截断 Q 函数,表示目标策略 rollout 前 n 步相对于完整动作价值的回报;(2)移位 Q 函数,作为该截断 rollout 之后的有远见回报。这种分解使我们能以各自的学习率优化两部分,获得显著的学习加速。我们证明这些短期与长期预测的组合是完整回报的一种表示,从而导出复合 Q-learning 算法。我们在表格情形下展示了复合 Q-learning 的有效性,并将深度复合 Q-learning 与 TD3 及 TD3(Delta) 进行比较,后者是我们引入的 TD(Delta) 的离策略变体。此外,我们表明在多个模拟机器人任务中,复合 TD3 在数据效率上显著优于 TD3 以及最先进的组合式 Q-learning 方法,且复合 Q-learning 对随机环境与奖励函数具有鲁棒性。

关键词

引用

@article{arxiv.1909.13518,
  title  = {Composite Q-learning: Multi-scale Q-function Decomposition and Separable Optimization},
  author = {Gabriel Kalweit and Maria Huegle and Joschka Boedecker},
  journal= {arXiv preprint arXiv:1909.13518},
  year   = {2020}
}