中文

PreND:通过预训练网络蒸馏提升强化学习中的内在动机

机器学习 2024-10-03 v1

摘要

内在动机灵感来自婴儿发展学习心理学,用以在没有依赖稀疏外部奖励的情况下刺激探索。现有的强化学习方法,如随机网络蒸馏(RND),面临诸多限制,包括:(1)依赖原始视觉输入,缺乏有意义的表征;(2)无法构建稳健的潜在空间;(3)目标网络初始化不佳;以及(4)内在奖励快速退化。本文引入了预训练网络蒸馏(PreND),这是一种新颖的方法,通过改进广泛使用的基于预测的方法 RND 来增强强化学习中的内在动机。PreND 通过将预训练表征模型整合到目标网络和预测网络中,从而获得更有意义且更稳定的内在奖励,同时增强模型所学习的表征。我们还通过控制学习率尝试了一些简单且有效的预测网络优化变体。基于 Atari 域的实验表明,PreND 在性能和样本效率方面显著优于 RND,提供了更稳健的内在动机信号,从而促进更好的探索。该研究凸显了基于预测的内在动机中目标网络和预测网络表征的重要性,为提高稀疏奖励环境中强化学习代理学习效率开辟了新方向。

关键词

引用

@article{arxiv.2410.01745,
  title  = {PreND: Enhancing Intrinsic Motivation in Reinforcement Learning through Pre-trained Network Distillation},
  author = {Mohammadamin Davoodabadi and Negin Hashemi Dijujin and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2410.01745},
  year   = {2024}
}

备注

8 pages, 4 figures