中文

长时程的涌现机制依赖于训练课程并影响记忆任务表现

神经与进化计算 2024-10-31 v3 神经元与认知

摘要

大脑与硅基中的循环神经网络(RNNs)擅长解决具有复杂时间依赖性的任务。解决此类任务所需的长时程可源于单个神经元的属性(单神经元时程,τ\tau,例如生物神经元中的膜时间常数)或它们之间的循环交互(网络介导时程)。然而,每种机制对最优解决记忆依赖任务的贡献仍知之甚少。在此,我们训练 RNNs 解决 NN-奇偶校验和 NN-延迟匹配样本任务,其随 NN 控制的递增记忆需求,同时优化循环权重与 τ\tau。我们发现,对于两项任务,RNNs 随 NN 增大而发展出更长时程,但取决于学习目标,它们使用不同机制。两种不同课程定义学习目标:单 NN(单头)的顺序学习或多 NN(多头)的同时学习。单头网络随 NN 增大其 τ\tau 并能为大 NN 解决任务,但遭受灾难性遗忘。然而,明确要求持有多个并发记忆的多头网络保持 τ\tau 恒定,并通过循环连接发展出更长时程。此外,我们表明多头课程提升了训练速度及网络对消融和扰动的稳定性,并允许 RNNs 更好地泛化至训练机制之外的任务。该课程也显著改善了用于大 NN 任务的 GRUs 和 LSTMs 的训练。我们的结果表明,通过循环交互使时程适应任务需求,可学习更复杂目标并提升 RNN 表现。

关键词

引用

@article{arxiv.2309.12927,
  title  = {Emergent mechanisms for long timescales depend on training curriculum and affect performance in memory tasks},
  author = {Sina Khajehabdollahi and Roxana Zeraati and Emmanouil Giannakakis and Tim Jakob Schäfer and Georg Martius and Anna Levina},
  journal= {arXiv preprint arXiv:2309.12927},
  year   = {2024}
}