中文

MaBERT:面向高效扩展上下文掩码语言建模的填充安全交错Transformer-Mamba混合编码器

计算与语言 2026-03-04 v1

摘要

自注意力编码器如双向编码器表示(BERT)在序列长度上呈二次方扩展,使得长上下文建模昂贵。线性时间状态空间模型(如Mamba)高效,但在建模全局相互作用方面存在局限,且可能因填充导致状态污染。我们提出MaBERT,一种交错堆叠Transformer层用于全局依赖建模与Mamba层用于线性时间状态更新的混合编码器。该设计在全局语境整合与快速状态累积之间交替,实现对长输入的高效训练与推理。为稳定可变长度批处理,我们引入填充安全掩码,阻断填充位置的状态传播;并引入掩码感知注意力池化,仅聚合有效token的信息。在GLUE基准上,MaBERT在八个任务中五个任务实现最佳均分,CoLA和句子对推理任务表现尤佳。当上下文长度从512扩展至4096时,MaBERT相较于编码器基线平均训练时间和推理延迟分别降低2.36倍和2.43倍,证明其实用且高效的长上下文编码器。

关键词

引用

@article{arxiv.2603.03001,
  title  = {MaBERT:A Padding Safe Interleaved Transformer Mamba Hybrid Encoder for Efficient Extended Context Masked Language Modeling},
  author = {Jinwoong Kim and Sangjin Park},
  journal= {arXiv preprint arXiv:2603.03001},
  year   = {2026}
}

备注

8 pages