中文

对齐状态空间模型中归纳偏置以实现数据高效泛化

机器学习 2026-05-06 v4

摘要

现代 AI 的显著成功与缩放定律密切相关,但高质量数据的有限供应使数据效率——用更少学习更多——成为日益重要的前沿。模型的归纳偏置是数据效率的关键杠杆,但如状态空间模型(SSM)等基础序列模型往往依赖固定的、与任务无关的偏置。当该固定先验与任务底层结构不匹配时,模型可能需要额外样本才能克服自身偏置再学习相关信号。在本工作中,我们引入了一个理解与对齐线性时不变 SSM 归纳偏置的原则性框架。我们首先通过 SSM 诱导核对该偏置进行形式化,并从理论和实证上表明其频谱由模型的频率响应决定。该表征启发了任务依赖初始化(TDI),一种快速的功率谱匹配方法,在下游训练之前将初始 SSM 偏置与任务的频谱特征对齐。在受控合成实验、可训练单层 SSM 以及多样化真实基准上的深度 SSM 中,当任务相关的频谱结构存在且默认 SSM 偏置在频谱上不匹配时,TDI 可以改善数据高效泛化。我们的结果同时提供了任务自适应归纳偏置的理论视角和实用工具,指向更高效序列建模的路径。

关键词

引用

@article{arxiv.2509.20789,
  title  = {Aligning Inductive Bias for Data-Efficient Generalization in State Space Models},
  author = {Qiyu Chen and Guozhang Chen},
  journal= {arXiv preprint arXiv:2509.20789},
  year   = {2026}
}