中文

分层软 actor-critic:基于互信息优化的对抗式探索

机器学习 2019-06-18 v1 人工智能 信息论 math.IT 机器学习

摘要

我们描述了一种利用互信息度量的、针对分层深度 Q 网络(HDQN)架构的软 actor-critic 新扩展。所提出的扩展为此类分层网络中的探索提供了一种合适的框架。该框架的一个自然应用是对抗式设定,其中元控制器与控制器在互信息目标上博弈极小极大,但在最大化期望奖励上相互协作。

关键词

引用

@article{arxiv.1906.07122,
  title  = {Hierarchical Soft Actor-Critic: Adversarial Exploration via Mutual Information Optimization},
  author = {Ari Azarafrooz and John Brock},
  journal= {arXiv preprint arXiv:1906.07122},
  year   = {2019}
}

备注

Presented at the ICML 2019 workshop on Imitation, Intent, and Interaction, Long Beach, CA, USA