中文

具有整数动作的 Soft Actor-Critic

机器学习 2022-03-15 v2 人工智能

摘要

强化学习在离散动作下已被充分研究。整数动作设定在工业中很常见,但由于其高维性仍具挑战性。为此,我们通过将 Soft Actor-Critic (SAC) 算法与整数重参数化相结合,研究整数动作下的强化学习。关于整数动作我们的关键观察是:其离散结构可利用可比性性质而简化。因此,所提出的整数重参数化不需要 one-hot 编码且为低维。实验表明,所提出的整数动作下 SAC 在机器人控制任务上与连续动作版本表现相当,并在配电系统控制任务上优于 Proximal Policy Optimization。

关键词

引用

@article{arxiv.2109.08512,
  title  = {Soft Actor-Critic With Integer Actions},
  author = {Ting-Han Fan and Yubo Wang},
  journal= {arXiv preprint arXiv:2109.08512},
  year   = {2022}
}

备注

The 2022 American Control Conference (ACC)