强化学习架构:SAC、TAC 与 ESAC
机器学习
2020-04-07 v1 信号处理
机器学习
摘要
当前的趋势是构建能够分析可用信息并高效利用它的智能体。本工作提出若干强化学习(RL)架构,其中之一专为智能体设计。所提出的架构称为选择器- actor-critic(SAC)、调谐器-actor-critic(TAC)和估计器-选择器-actor-critic(ESAC)。这些架构是 RL 中著名架构 actor-critic(AC)的改进模型。在 AC 中,actor 优化所用策略,而 critic 估计价值函数并评估 actor 优化的策略。SAC 是一种配备 actor、critic 和选择器的架构。选择器基于 critic 的最新估计确定当前状态下最有前景的动作。TAC 由调谐器、模型学习器、actor 和 critic 组成。在从 critic 接收到当前状态-动作对的近似价值并从模型学习器接收到学习到的模型后,调谐器使用 Bellman 方程来调整当前状态-动作对的价值。ESAC 基于前瞻(lookahead)与直觉(intuition)两个思想提出以实现智能体。前瞻体现在估计下一状态可用动作的价值,而直觉体现在最大化选择最有前景动作的概率。新增加的元素包括一个底层模型学习器、一个估计器和一个选择器。模型学习器用于近似底层模型。估计器使用近似价值函数、学习到的底层模型以及 Bellman 方程来估计下一状态所有动作的价值。选择器用于确定下一状态最有前景的动作,该动作将由 actor 用于优化所用策略。最后,结果表明 ESAC 相较于其他架构具有优越性。
引用
@article{arxiv.2004.02274,
title = {Reinforcement Learning Architectures: SAC, TAC, and ESAC},
author = {Ala'eddin Masadeh and Zhengdao Wang and Ahmed E. Kamal},
journal= {arXiv preprint arXiv:2004.02274},
year = {2020}
}