中文

强化学习中有限记忆资源的动态分配

神经元与认知 2020-11-16 v2

摘要

生物大脑在处理和存储信息的能力上固有地受限,但却能看似轻松地解决复杂任务。智能行为与这些限制相关,因为资源约束催生了泛化的需求,并促使对环境中特征或过去经验记忆差异化地赋予重要性。近来,强化学习和神经科学中分别有研究致力于理解人工与生物智能体为规避信息存储限制所采用的策略。然而,这两条研究脉络在很大程度上是分离的。在本文中,我们提出一个在有限资源约束下最大化期望收益的动力学框架,并以一个代价函数实现之,该函数对记忆中动作值的精确表征进行惩罚,且各动作值表征的精度可以不同。我们从第一性原理推导出一种算法——动态资源分配器(Dynamic Resource Allocator, DRA),将其应用于强化学习中的两个标准任务和一个基于模型的规划任务,发现它向记忆中对累积收益影响更大的条目分配了更多资源。此外,DRA 在起始资源预算高于其最终为良好完成任务所分配的量时学习更快,这或许解释了为何生物大脑的前额叶皮层区域在学习的早期阶段更为活跃,之后才稳定到较低的活动渐近水平。我们的工作针对如何以能适应环境变化的方式,将昂贵资源分配给一组不确定记忆的学习问题,提供了一个规范性解。

关键词

引用

@article{arxiv.2011.06387,
  title  = {Dynamic allocation of limited memory resources in reinforcement learning},
  author = {Nisheet Patel and Luigi Acerbi and Alexandre Pouget},
  journal= {arXiv preprint arXiv:2011.06387},
  year   = {2020}
}

备注

In Advances in Neural Information Processing Systems 33 (NeurIPS 2020). [16 pages: 9 main + 3 references + 4 supplementary; 4 figures: 3 main + 1 supplementary]