中文

深度强化学习中按需探索更多

机器学习 2021-09-29 v1 人工智能

摘要

我们提出了一种深度强化学习中策略的探索机制,即智能体需要时探索更多,称为 Add Noise to Noise(AN2N,向噪声加噪声)。核心思想是:当深度强化学习智能体处于历史上表现不佳的状态时,它需要探索更多。因此我们使用累积奖励来评估智能体哪些过去状态表现不好,并使用余弦距离衡量当前状态是否需要更多探索。该方法表明智能体策略的探索机制有利于高效探索。我们将提出的探索机制 AN2N 与 Deep Deterministic Policy Gradient(DDPG,深度确定性策略梯度)、Soft Actor-Critic(SAC,软 actor-critic)算法结合,并应用于连续控制任务领域,如 halfCheetah、Hopper 和 Swimmer,在性能与收敛速度上取得了可观提升。

关键词

引用

@article{arxiv.2109.13477,
  title  = {Exploring More When It Needs in Deep Reinforcement Learning},
  author = {Youtian Guo and Qi Gao},
  journal= {arXiv preprint arXiv:2109.13477},
  year   = {2021}
}

备注

7 pages