中文

万事一网:面向通用问题求解的单一网络

人工智能 2018-02-27 v1

摘要

我将近期关于“学习思考”(2015)与 PowerPlay (2011) 的工作应用于对一个日益通用的问题求解器的增量训练,持续学习解决新任务而不遗忘已有技能。该问题求解器是一个称为 ONE 的单一循环神经网络(或类似的通用计算机)。ONE 的不同寻常之处在于它以多种方式接受训练,例如通过黑箱优化/强化学习/人工进化以及监督/无监督学习。例如,ONE 可通过神经进化学习通过环境改变型动作控制机器人,并如 1990 年所建议的那样通过无监督梯度下降学习预测未来输入与向量值奖励信号。用户给定的任务可通过额外的目标定义输入模式来规定,这也于 1990 年提出。假设 ONE 已学会许多技能。此时可将 ONE 的一份副本重新训练以学习一项新技能,例如通过无教师神经进化。在此过程中它可受益于复用先前习得的子程序,但也可能遗忘已有技能。随后 ONE 以 PowerPlay 风格(2011)在以下存储的输入/输出轨迹上被重新训练:(a) ONE 副本执行新技能的轨迹,以及 (b) 仍被认为值得记忆其技能的 ONE 先前实例的轨迹。同时,ONE 在旧轨迹(甚至失败尝试的轨迹)上被重新训练以成为更好的预测器,而无需与环境的额外昂贵交互。越来越多的控制与预测技能由此被压缩进 ONE,如同神经历史压缩器(1991)中的分块—自动化系统。这迫使 ONE 将部分类比的技能(带有共享算法信息)相互关联,以共享子网络的形式在 ONE 内部创建公共子程序,从而极大加速后续对附加的、新颖但算法相关的技能的学习。

关键词

引用

@article{arxiv.1802.08864,
  title  = {One Big Net For Everything},
  author = {Juergen Schmidhuber},
  journal= {arXiv preprint arXiv:1802.08864},
  year   = {2018}
}

备注

17 pages, 107 references