中文

谨慎 actor-critic

机器学习 2021-10-06 v2 人工智能

摘要

离策略学习的性能振荡以及 actor-critic (AC) 设定中持续存在的误差,呼唤能够保守学习以更好地适应稳定性关键应用的算法。本文提出一种新颖的离策略 AC 算法——谨慎 actor-critic (CAC)。其“谨慎”之名源于我们所利用的双重保守特性:对 actor 采用保守策略迭代中的经典策略插值,对 critic 采用保守值迭代的熵正则化。我们的核心观察是,熵正则化 critic 促进并简化了笨重的插值 actor 更新,同时仍确保稳健的策略改进。我们在一组具有挑战性的连续控制问题上将 CAC 与最先进的 AC 方法进行比较,结果表明 CAC 在取得相当性能的同时显著稳定了学习。

关键词

引用

@article{arxiv.2107.05217,
  title  = {Cautious Actor-Critic},
  author = {Lingwei Zhu and Toshinori Kitamura and Takamitsu Matsubara},
  journal= {arXiv preprint arXiv:2107.05217},
  year   = {2021}
}

备注

Accepted by Asian Conference on Machine Learning (ACML) 2021 as long oral presentation