中文

理解与控制 RNN 中记忆组织的几何结构

神经元与认知 2025-02-12 v1

摘要

训练循环神经网络 (RNN) 是一个高维过程,需要更新大量参数,因此往往难以确定其背后的学习机制。为此,我们提出通过研究训练以执行多种短期记忆任务的 RNN,以了解 \emph{突发学习} 现象的机制。在这些任务中,RNN 训练开始于初始搜索阶段。随后在准确率停滞一段时间后,损失函数的值会骤然下降,表现为突发学习。分析这些 RNN 执行的神经计算揭示,其相空间中存在突发几何重构 (GR)。为促进这些 GR 事件,我们引入一种时间一致性正则化,以加速(生物可信的)训练、促进吸引子形成,并在强连通网络中实现高效学习。我们的发现为神经科学家提供了可测试的预测,并强调需要目标无关的次生机制来促进生物和人工网络中的学习。

关键词

引用

@article{arxiv.2502.07256,
  title  = {Understanding and controlling the geometry of memory organization in RNNs},
  author = {Udith Haputhanthri and Liam Storan and Yiqi Jiang and Tarun Raheja and Adam Shai and Orhun Akengin and Nina Miolane and Mark J. Schnitzer and Fatih Dinc and Hidenori Tanaka},
  journal= {arXiv preprint arXiv:2502.07256},
  year   = {2025}
}