长时程的涌现机制依赖于训练课程并影响记忆任务表现
神经与进化计算
2024-10-31 v3 神经元与认知
摘要
大脑与硅基中的循环神经网络(RNNs)擅长解决具有复杂时间依赖性的任务。解决此类任务所需的长时程可源于单个神经元的属性(单神经元时程,,例如生物神经元中的膜时间常数)或它们之间的循环交互(网络介导时程)。然而,每种机制对最优解决记忆依赖任务的贡献仍知之甚少。在此,我们训练 RNNs 解决 -奇偶校验和 -延迟匹配样本任务,其随 控制的递增记忆需求,同时优化循环权重与 。我们发现,对于两项任务,RNNs 随 增大而发展出更长时程,但取决于学习目标,它们使用不同机制。两种不同课程定义学习目标:单 (单头)的顺序学习或多 (多头)的同时学习。单头网络随 增大其 并能为大 解决任务,但遭受灾难性遗忘。然而,明确要求持有多个并发记忆的多头网络保持 恒定,并通过循环连接发展出更长时程。此外,我们表明多头课程提升了训练速度及网络对消融和扰动的稳定性,并允许 RNNs 更好地泛化至训练机制之外的任务。该课程也显著改善了用于大 任务的 GRUs 和 LSTMs 的训练。我们的结果表明,通过循环交互使时程适应任务需求,可学习更复杂目标并提升 RNN 表现。
引用
@article{arxiv.2309.12927,
title = {Emergent mechanisms for long timescales depend on training curriculum and affect performance in memory tasks},
author = {Sina Khajehabdollahi and Roxana Zeraati and Emmanouil Giannakakis and Tim Jakob Schäfer and Georg Martius and Anna Levina},
journal= {arXiv preprint arXiv:2309.12927},
year = {2024}
}