中文

论学习思考:面向强化学习控制器与循环神经网络世界模型新颖组合的算法信息论

人工智能 2015-12-01 v1 机器学习 神经与进化计算

摘要

本文探讨部分可观测环境中强化学习(RL)的普遍问题。2013 年,我们的大型 RL 循环神经网络(RNNs)从零开始学会了从高维视频输入驾驶模拟汽车。然而,真实大脑在许多方面更为强大。特别是,它们学习对其初始未知环境的预测模型,并以某种方式将其用于抽象(例如分层)规划与推理。在算法信息论指导下,我们描述了旨在实现相同功能的基于 RNN 的 AI(RNNAI)。此类 RNNAI 可以在永不停歇的任务序列上训练,其中一些由用户提供,另一些由 RNNAI 自身以好奇、玩闹的方式发明,以改进其基于 RNN 的世界模型。与我们可追溯到 1990 年的先前基于 RNN 的建模型 RL 机器不同,RNNAI 学会主动查询其模型以进行抽象推理、规划和决策,本质上是“学习思考”。本报告的基本思想可应用于许多其他情况,其中一个类 RNN 系统利用另一个系统的算法信息内容。这些思想取自 2014 年秋提交的一份基金申请书,并也解释了诸如“镜像神经元”的概念。实验结果将在独立的论文中描述。

关键词

引用

@article{arxiv.1511.09249,
  title  = {On Learning to Think: Algorithmic Information Theory for Novel Combinations of Reinforcement Learning Controllers and Recurrent Neural World Models},
  author = {Juergen Schmidhuber},
  journal= {arXiv preprint arXiv:1511.09249},
  year   = {2015}
}

备注

36 pages, 1 figure. arXiv admin note: substantial text overlap with arXiv:1404.7828