中文

基于Kalman时序差分的概率化后继表示

神经元与认知 2019-10-08 v1 机器学习

摘要

强化学习(RL)的有效性取决于动物将奖励归功于适当先前刺激的能力。理解该过程神经基础的一个方面涉及理解何种刺激表示支持泛化。后继表示(SR)强制对预测相似结果的状态进行泛化,已成为此类探究中日益流行的模型。信用分配的另一个维度涉及理解动物如何使用概率方法(如Kalman时序差分(KTD))处理所学关联的不确定性。结合这些方法,我们提出使用KTD估计SR上的分布。KTD-SR捕捉对估计SR的不确定性以及不同长期预测间的协方差。我们表明,正因为此,KTD-SR在该实验中无需额外回放即表现出如同人类的部分转移重估,不同于标准TD-SR算法。最后我们讨论了KTD-SR作为预测性与概率性动物推理交互模型的未来应用。

关键词

引用

@article{arxiv.1910.02532,
  title  = {Probabilistic Successor Representations with Kalman Temporal Differences},
  author = {Jesse P. Geerts and Kimberly L. Stachenfeld and Neil Burgess},
  journal= {arXiv preprint arXiv:1910.02532},
  year   = {2019}
}

备注

Conference on Cognitive Computational Neuroscience