中文

在简单环境中利用分层 Q 网络学习基于模型的策略

人工智能 2018-01-23 v1

摘要

深度学习的近期进展使人工智能体在广泛复杂任务上达到人类水平表现;然而,这些网络学习可泛化策略的能力仍是一项紧迫挑战。这一关键局限部分源于两个因素:深度神经网络中不透明的信息表示,以及它们通常部署的任务环境的复杂性。此处我们提出一种新颖的分层 Q 网络(HQN),其受人类前额叶皮层分层组织理论启发,试图在价值地形中识别可被利用来在简单环境中构建规则内部模型的低维模式。我们借助组合博弈(其中存在单一最优获胜策略可泛化至博弈其他特征)来探究 HQN 与其他强化学习(RL)智能体在使用 Wythoff 博弈变体时的策略泛化能力。传统 RL 方法在 Wythoff 博弈变体上未能达到满意表现;而 HQN 学习了跨棋盘配置变化泛化的类启发式策略。更重要的是,HQN 允许在训练后透明检视智能体对博弈的内部模型。我们的结果表明,受生物学启发的分层学习器如何能促进在具有明确最优策略的简化训练环境中学习抽象规则,以促成鲁棒且灵活的动作策略。

关键词

引用

@article{arxiv.1801.06689,
  title  = {Learning model-based strategies in simple environments with hierarchical q-networks},
  author = {Necati Alp Muyesser and Kyle Dunovan and Timothy Verstynen},
  journal= {arXiv preprint arXiv:1801.06689},
  year   = {2018}
}