模仿初始化帮助状态空间模型学习记忆
机器学习
2024-10-16 v1 计算与语言
摘要
最近的工作表明,状态空间模型如 Mamba 在基于记忆的任务上显著劣于 Transformer,原因在于其状态大小不随输入序列长度而变化。然而在实际应用中,状态空间模型拥有相当大的状态大小,我们推测它们在此类任务上的表现应远优于先前报告的结果。我们探讨其差励的复制和记忆性能是否部分源于训练困难而非根本的容量限制。基于对其“注意力”图的观察,我们提出一种结构化初始化技术,使状态空间层能够更容易地模仿注意力。在多种架构设置下,我们的初始化显著简化了 Mamba 从头学习复制和执行关联记忆的难度。
引用
@article{arxiv.2410.11135,
title = {Mimetic Initialization Helps State Space Models Learn to Recall},
author = {Asher Trockman and Hrayr Harutyunyan and J. Zico Kolter and Sanjiv Kumar and Srinadh Bhojanapalli},
journal= {arXiv preprint arXiv:2410.11135},
year = {2024}
}