中文

一种面向策略的贝叶斯软 actor-critic 模型

人工智能 2023-03-09 v1 机器学习 多智能体系统 机器人学 系统与控制 系统与控制

摘要

在危险、非结构化与动态环境中,采用合理策略对资源受限的智能体而言困难却至关重要,可提升系统效用、降低总体成本并提高任务成功概率。本文提出一种基于贝叶斯链式法则的新颖分层策略分解方法,将复杂策略分离为若干简单子策略,并将其关系组织为贝叶斯策略网络(BSN)。我们将该方法集成至最先进的DRL方法——软actor-critic(SAC),并通过将若干子策略组织为联合策略构建相应的贝叶斯软actor-critic(BSAC)模型。我们在OpenAI Gym环境下的MuJoCo标准连续控制基准Hopper-v2、Walker2d-v2与Humanoid-v2上,将所提BSAC方法与SAC及其他最先进方法(如TD3、DDPG与PPO)比较。结果表明,BSAC方法显著提升训练效率,潜力可观。

关键词

引用

@article{arxiv.2303.04193,
  title  = {A Strategy-Oriented Bayesian Soft Actor-Critic Model},
  author = {Qin Yang and Ramviyas Parasuraman},
  journal= {arXiv preprint arXiv:2303.04193},
  year   = {2023}
}

备注

Accepted by the Elsevier Science 14th International Conference on Ambient Systems, Networks and Technologies (ANT 2023). arXiv admin note: substantial text overlap with arXiv:2208.06033, arXiv:2302.13132