中文

一种在部分可观测环境中学习后继表示的神经可信模型

机器学习 2019-06-25 v1 机器学习 神经与进化计算 神经元与认知

摘要

动物需要基于传入的含噪感官观测,在制定策略以与其环境交互时最大化回报。任务相关状态,如智能体在环境中的位置或捕食者的出现,往往不能直接观测,而必须利用可用感官信息推断。后继表示(SR)被提出作为基于模型与无模型强化学习策略之间的中间方案,允许快速价值计算并快速适应奖励函数或目标位置的变化。确实,近期研究表明神经响应的特征与SR框架一致。然而,尚不清楚此类表示如何在部分观测的含噪环境中被学习与计算。在此,我们引入一种使用分布式后继特征的神经可信模型,其建立在用于不确定性的表示与计算的分布式分布编码之上,并允许通过后继表示在部分观测环境中进行高效价值函数计算。我们表明分布式后继特征可支持在直接学习成功策略不可行的含噪环境中的强化学习。

关键词

引用

@article{arxiv.1906.09480,
  title  = {A neurally plausible model learns successor representations in partially observable environments},
  author = {Eszter Vertes and Maneesh Sahani},
  journal= {arXiv preprint arXiv:1906.09480},
  year   = {2019}
}