中文

贝叶斯软演员-评论家:一种基于有向无环策略图的深度强化学习

人工智能 2023-12-06 v2 机器学习 机器人学

摘要

采用合理策略对于在危险、非结构化与动态环境中工作的资源受限智能体而言充满挑战却至关重要,其可提升系统效用、降低总体成本并提高任务成功概率。本文提出一种基于贝叶斯链的新型有向无环策略图分解方法,将复杂策略分离为若干简单子策略,并将其关系组织为贝叶斯策略网络(BSN)。我们将该方法集成至最先进的 DRL 方法——软演员-评论家(SAC)中,并通过将若干子策略组织为联合策略构建相应的贝叶斯软演员-评论家(BSAC)模型。我们在 OpenAI Gym 环境下的标准连续控制基准上,将我们的方法与最先进的深度强化学习算法进行比较。结果表明,BSAC 方法展现出显著提升训练效率的潜力。

关键词

引用

@article{arxiv.2208.06033,
  title  = {Bayesian Soft Actor-Critic: A Directed Acyclic Strategy Graph Based Deep Reinforcement Learning},
  author = {Qin Yang and Ramviyas Parasuraman},
  journal= {arXiv preprint arXiv:2208.06033},
  year   = {2023}
}