中文

参数化动作空间中的深度强化学习

人工智能 2024-05-06 v5 机器学习 多智能体系统 神经与进化计算

摘要

近期的研究表明,深度神经网络能够在具有连续状态和动作空间的强化学习领域中逼近值函数与策略。然而,据我们所知,此前尚无工作在结构化(参数化)连续动作空间中使用深度神经网络取得成功。为填补这一空白,本文聚焦于模拟 RoboCup 足球领域中的学习,该领域具有一小组离散动作类型,每种类型由连续变量参数化。所学得的最优智能体比 2012 年 RoboCup 冠军智能体更能稳定地进球。因此,本文代表了深度强化学习向参数化动作空间 MDP 类的一次成功扩展。

关键词

引用

@article{arxiv.1511.04143,
  title  = {Deep Reinforcement Learning in Parameterized Action Space},
  author = {Matthew Hausknecht and Peter Stone},
  journal= {arXiv preprint arXiv:1511.04143},
  year   = {2024}
}