中文

消除偏差启发式引导的强化学习算法

机器学习 2024-05-02 v1 人工智能 机器人学

摘要

强化学习已在许多 Atari 游戏中取得巨大成功。本文中我们探索了 lunar lander 环境并实现了包括 Q-Learning、SARSA、MC 以及平铺编码在内的经典方法。我们还实现了基于神经网络的方法,包括 DQN、Double DQN、Clipped DQN。在此基础上,我们提出了一种称为启发式强化学习(Heuristic RL)的新算法,其利用启发式引导早期训练,同时缓解所引入的人类偏差。我们的实验在 lunar lander 环境中对我们提出的方法展示了有前景的结果。

关键词

引用

@article{arxiv.2306.10216,
  title  = {Vanishing Bias Heuristic-guided Reinforcement Learning Algorithm},
  author = {Qinru Li and Hao Xiang},
  journal= {arXiv preprint arXiv:2306.10216},
  year   = {2024}
}

备注

Robotics;Reinforcement Learning;