中文

深度强化学习中的预测式辅助目标模仿大脑学习

人工智能 2024-10-31 v3

摘要

预测即将发生事件的能力被假设为自然与机器认知的关键方面。深度强化学习(RL)中的趋势支持这一点,其中预测等自监督辅助目标被广泛用于支持表示学习并提升任务表现。在此,我们研究预测式辅助目标对 RL 系统不同模块表示学习的影响,以及这些如何模仿大脑中观察到的表示变化。我们发现预测目标尤其改善并稳定资源受限架构中的学习,并确定了更长预测时域更好支持表示迁移的设置。此外,我们发现该 RL 系统中的表示变化与多种实验中观察到的大脑神经活动变化极为相似。具体而言,我们将 RL 系统的辅助预测模型与海马体联系起来,后者被认为学习预测模型以支持记忆引导行为。我们还将 RL 系统的编码器网络与价值学习网络分别联系到大脑中的视觉皮层与纹状体。本工作展示了深度 RL 系统中的表示学习如何为建模大脑多区域交互提供可解释框架。此处采用的深度 RL 视角还暗示了海马体在大脑中的额外作用——即一个有益于其他区域表示学习的辅助学习系统。

关键词

引用

@article{arxiv.2310.06089,
  title  = {Predictive auxiliary objectives in deep RL mimic learning in the brain},
  author = {Ching Fang and Kimberly L Stachenfeld},
  journal= {arXiv preprint arXiv:2310.06089},
  year   = {2024}
}