TransXSSM:具有统一旋转位置编码的混合 Transformer 状态空间模型
计算与语言
2025-06-19 v3 人工智能
摘要
Transformer 在捕捉长程依赖方面表现出色,而状态空间模型(SSM)则支持线性时间序列建模。尽管它们具有协同潜力,但将这两种架构进行集成面临重大挑战,主要源于各自位置编码机制的根本不一致:Transformer 依赖显式的旋转位置编码(RoPE),而 SSM 则通过卷积利用隐式位置表示。这种差异往往导致不连续和次优性能。为解决这一障碍,我们提出了一种统一旋转位置编码(Unified RoPE)方法,从而为自注意力和状态空间组件建立了统一的位置编码框架。利用这种统一 RoPE,我们引入了 TransXSSM,一种在统一位置编码方案下连贯集成 Transformer 和 SSM 层的混合架构。在序列长度为 4K 时,TransXSSM 的训练和推理速度分别比标准 Transformer 模型快 42.3% 和 29.5%。它还实现了更高的准确率:在可比设置下,在语言建模基准测试上超越了 Transformer 基线超过 4%。TransXSSM 进一步实现了更有效的扩展:TransXSSM-1.3B 相比其 320M 版本平均准确率提升了 7.22%(而等效的 Transformer 或 SSM 仅提升约 6%)。我们的结果表明,统一位置编码解决了混合模型中的位置不兼容问题,实现了高效、高性能的长上下文建模。
引用
@article{arxiv.2506.09507,
title = {TransXSSM: A Hybrid Transformer State Space Model with Unified Rotary Position Embedding},
author = {Bingheng Wu and Jingze Shi and Yifan Wu and Nan Tang and Yuyu Luo},
journal= {arXiv preprint arXiv:2506.09507},
year = {2025}
}