中文

基于分布随机网络蒸馏的探索与反探索

机器学习 2024-05-21 v4

摘要

探索仍然是深度强化学习中的关键问题,智能体需在未知环境中获得高回报。尽管主流的探索算法随机网络蒸馏 (Random Network Distillation, RND) 已在众多环境中被证明有效,但其在奖励分配中往往缺乏足够的区分能力。本文强调了 RND 中的“奖励不一致性”问题,并指出了其主要局限性。为解决此问题,我们引入了 RND 的衍生算法——分布随机网络蒸馏 (Distributional RND, DRND)。DRND 通过蒸馏随机网络的分布并隐式整合伪计数,增强了探索过程,提高了奖励分配的精度。这种改进鼓励智能体进行更广泛的探索。我们的方法有效缓解了一致性问题,且未引入显著的计算开销。理论分析和实验结果均表明,我们的方法优于原始 RND 算法。我们的方法在具有挑战性的在线探索场景中表现出色,并在 D4RL 离线任务中有效地充当了反探索机制。我们的代码已公开:https://github.com/yk7333/DRND。

关键词

引用

@article{arxiv.2401.09750,
  title  = {Exploration and Anti-Exploration with Distributional Random Network Distillation},
  author = {Kai Yang and Jian Tao and Jiafei Lyu and Xiu Li},
  journal= {arXiv preprint arXiv:2401.09750},
  year   = {2024}
}

备注

ICML 2024 accepted