中文

估计时谨慎,探索时大胆

机器学习 2023-08-23 v1

摘要

由于动作空间连续且无限,连续动作空间中的探索策略往往是启发式的,这类方法无法得出一般性结论。先前工作表明,在确定性策略强化学习(DPRL)中,基于策略的探索有益于连续动作空间。然而,DPRL 中基于策略的探索存在两个突出问题:盲目探索与策略发散,且由于估计不准确,用于探索的策略梯度仅有时有效。基于双 Q 函数框架,我们引入了一种独立于策略梯度的新颖探索策略以缓解这些问题。我们首先提出用于 Q 值更新的贪婪 Q softmax 更新方案。期望 Q 值通过对动作上的保守 Q 值进行加权和得到,权重为对应的贪婪 Q 值。贪婪 Q 取两个 Q 函数的最大值,保守 Q 取两个不同 Q 函数的最小值。为实用起见,该理论基础随后被扩展,使我们能将动作探索与 Q 值更新相结合,前提是我们有一个表现类似于该探索策略的替代策略。实践中,我们用少量采样动作构造这样的探索策略,并且为满足前提,我们通过最小化目标策略与由保守 Q 构造的探索策略之间的 KL 散度来学习该替代策略。我们在 Mujoco 基准上评估了我们的方法,并在各类环境中展示了优于先前最先进方法的性能,尤其是在最复杂的 Humanoid 环境中。

关键词

引用

@article{arxiv.2308.11348,
  title  = {Careful at Estimation and Bold at Exploration},
  author = {Xing Chen and Yijun Liu and Zhaogeng Liu and Hechang Chen and Hengshuai Yao and Yi Chang},
  journal= {arXiv preprint arXiv:2308.11348},
  year   = {2023}
}

备注

20 pages