中文

序列决策中的单次学习与行为资格迹

神经元与认知 2019-11-13 v3

摘要

在许多日常任务中,我们在达到目标前会做出多个决策。为了学习此类决策序列,需要将较早的动作与后来的奖励联系起来的机制。强化学习理论提出了两类解决该信用分配问题的算法:在经典时序差分学习中,较早的动作仅在该任务多次重复后才接收到奖励信息,而带资格迹的模型则从单次经验(单次学习)中强化整个动作序列。在此我们探究人类是否使用资格迹。我们开发了一种新颖的范式,以直接观察在多步序列中哪些动作和状态在单次奖励后得到强化。通过将分析聚焦于那些带与不带资格迹的强化学习做出定性不同预测的状态,我们发现了跨多种感觉模态的、带有资格迹的强化学习的直接行为(选择概率)和生理(瞳孔扩张)特征。

关键词

引用

@article{arxiv.1707.04192,
  title  = {One-shot learning and behavioral eligibility traces in sequential decision making},
  author = {Marco Lehmann and He Xu and Vasiliki Liakoni and Michael Herzog and Wulfram Gerstner and Kerstin Preuschoff},
  journal= {arXiv preprint arXiv:1707.04192},
  year   = {2019}
}