中文

Chimera:超越序列的状态空间模型

机器学习 2025-10-15 v1 人工智能

摘要

基于Transformer的深度学习方法已成为建模多样化数据(如序列、图像和图形)的标准方法。这些方法依赖于自注意力机制,将数据视为无序元素集合。这忽略了数据中的邻域结构或图拓扑,要求引入归纳偏置——例如序列和图像中的位置嵌入,或图中的随机游走。然而,设计此类任务特定的偏置需要大量工作,且可能引入副作用影响泛化。我们引入Chimera,一种直接以原则方式整合数据拓扑的统一模型,消除对特定领域偏置的需求。关键思想是,状态空间模型天然不需要位置嵌入,可推广到捕获任何图拓扑。我们的实验表明,Chimera在语言、视觉和图形领域均实现强大的性能,在GLUE上超过BERT 0.7分,在ImageNet-1k上超过ViT 2.6%,在Long Range Graph Benchmark上超越所有基线。我们进一步提出算法优化以提高Chimera的效率:(1)对于有向无环图,Chimera可实现线性时间递归;(2)对于一般图,一种简单的数学松弛实现Transformer的二次复杂性,无需特定领域的启发式方法。这些结果验证了Chimera的核心贡献,支持数据拓扑是跨模态强大的归纳偏置的观念。

关键词

引用

@article{arxiv.2510.12111,
  title  = {Chimera: State Space Models Beyond Sequences},
  author = {Aakash Lahoti and Tanya Marwah and Ratish Puduppully and Albert Gu},
  journal= {arXiv preprint arXiv:2510.12111},
  year   = {2025}
}

备注

Published in TMLR (October 2025); 22 Pages, 6 Figures, 11 Tables