社交环境中的深度好奇循环
神经与进化计算
2018-06-12 v1
摘要
受婴儿内在学习动机的启发——其重视依赖于即时社交环境的信息性感觉通道——我们开发了深度好奇循环(DCL)架构。DCL 由一个学习器和一个新颖的强化学习(RL)组件构成:学习器试图学习智能体状态-动作转移的向前模型,而该 RL 组件即动作卷积深度 Q 网络(Action-Convolution Deep Q-Network),它使用学习器的预测误差作为奖励。我们智能体的环境由视觉社交场景组成,即情景喜剧视频流,因此学习器和 RL 均构建为深度卷积神经网络。智能体的学习器学习预测视觉场景动力学的零阶,产生与其社交环境内变化成正比的内在奖励。情景喜剧中这些社交信息变化的来源主要是人脸和手的运动,从而导致基于好奇心的社交交互特征的无监督学习。人脸和手检测由价值函数表示,社交交互光流由策略表示。我们的结果表明,人脸和手检测是基于社交环境中好奇心学习的涌现属性。
引用
@article{arxiv.1806.03645,
title = {Deep Curiosity Loops in Social Environments},
author = {Jonatan Barkan and Goren Gordon},
journal= {arXiv preprint arXiv:1806.03645},
year = {2018}
}
备注
10 pages, 3 figures, submitted to NIPS 2018