端到端强化学习中涌现的功能——迈向通用人工智能之路
人工智能
2017-05-17 v2
摘要
近期,受谷歌 DeepMind 在电视游戏或围棋中取得的瞩目成果所触发,端到端强化学习(RL)正受到广泛关注。尽管鲜为人知,作者团队已倡导这一框架约 20 年,并已展示了通过强化学习在神经网络(NN)中涌现的多种功能。本文在此契机下再次介绍这些功能。“功能模块化”方法已深入人心。学习系统的输入与输出可以是原始传感器信号与运动指令。强化学习中通常使用的“状态空间”或“动作空间”揭示了功能模块的存在,这曾将强化学习局限于仅学习动作规划模块。为将强化学习扩展至大规模并行学习系统巨大自由度上的整体功能学习,并解释或发展类人智能,作者坚信,使用循环神经网络(RNN)实现从传感器到执行器的端到端强化学习成为关键。尤其在高级功能中,该方法因无需预先确定其输入与输出而极为有效。我们已证实,通过基于神经网络的强化学习涌现的功能涵盖广泛,从基于原始相机像素输入的实体机器人学习,到循环神经网络中动态功能的获取。这些功能包括:(1)图像识别,(2)颜色恒常性(视错觉),(3)传感器运动(主动识别),(4)手眼协调与伸手运动,(5)脑活动解释,(6)通信,(7)知识迁移,(8)记忆,(9)选择性注意,(10)预测,(11)探索。端到端强化学习使非常灵活的综合功能得以涌现,这些功能能并行考虑诸多因素,尽管难以清晰界定每种功能的边界。
引用
@article{arxiv.1703.02239,
title = {Functions that Emerge through End-to-End Reinforcement Learning - The Direction for Artificial General Intelligence -},
author = {Katsunari Shibata},
journal= {arXiv preprint arXiv:1703.02239},
year = {2017}
}
备注
The Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM) 2017, 5 pages, 4 figures