中文

基于重置深度集成智能体的样本高效且安全的深度强化学习

机器学习 2023-11-01 v1 人工智能

摘要

深度强化学习(RL)通过与深度神经网络(DNN)作为函数逼近器的结合,在解决复杂任务方面取得了显著成功。然而,对 DNN 的依赖引入了一种称为首要偏差(primacy bias)的新挑战,即这些函数逼近器倾向于优先考虑早期经验,导致过拟合。为缓解这一首要偏差,已有研究提出一种重置方法,该方法在保留回放缓冲区的同时对深度 RL 智能体的部分或全部进行周期性重置。然而,重置方法的使用可能导致重置后性能崩溃,从安全 RL 和遗憾最小化的角度来看是有害的。本文提出一种新的基于重置的方法,利用深度集成学习来解决原始重置方法的局限性并提升样本效率。所提方法通过包括安全 RL 领域在内的多种实验进行了评估。数值结果表明了其在高样本效率和安全考量方面的有效性。

关键词

引用

@article{arxiv.2310.20287,
  title  = {Sample-Efficient and Safe Deep Reinforcement Learning via Reset Deep Ensemble Agents},
  author = {Woojun Kim and Yongjae Shin and Jongeui Park and Youngchul Sung},
  journal= {arXiv preprint arXiv:2310.20287},
  year   = {2023}
}

备注

NeurIPS 2023 camera-ready