状态空间模型训练中的压缩的奇特案例
机器学习
2026-02-26 v4
摘要
状态空间模型 (SSM) 用于高效解决长序列建模任务,具备可并行训练和快速推理优势。其核心是保持隐藏状态的递归动力系统,更新成本随状态维度而增。关键设计挑战在于在最大化表达性与限制计算负担之间取得平衡。控制理论,特别是 Hankel 奇异值分析,为衡量每个状态能量以及将原系统削减至更小表示并保障性能的框架提供了强大工具。利用 Hankel 矩阵的特征值稳定性,我们将其视角应用到 SSM 的训练期间,仅识别并保留高影响维度。我们的做法 \textsc{CompreSSM} 可用于线性时不变 SSM,如线性循环单元 (LSTM),但也可扩展至选择性模型。实验表明,训练期间的压缩显著加速优化,同时保持表达性,压缩后模型保留任务关键结构,这一结构是直接在更小维度上训练的模型所丢失的。换言之,起初较大且在训练期间缩小的 SSM 实现了计算效率,同时保持更高性能。项目代码已于 github.com/camail-official/compressm 提供。
引用
@article{arxiv.2510.02823,
title = {The Curious Case of In-Training Compression of State Space Models},
author = {Makram Chahine and Philipp Nazari and Daniela Rus and T. Konstantin Rusch},
journal= {arXiv preprint arXiv:2510.02823},
year = {2026}
}