MaBERT:面向高效扩展上下文掩码语言建模的填充安全交错Transformer-Mamba混合编码器
计算与语言
2026-03-04 v1
摘要
自注意力编码器如双向编码器表示(BERT)在序列长度上呈二次方扩展,使得长上下文建模昂贵。线性时间状态空间模型(如Mamba)高效,但在建模全局相互作用方面存在局限,且可能因填充导致状态污染。我们提出MaBERT,一种交错堆叠Transformer层用于全局依赖建模与Mamba层用于线性时间状态更新的混合编码器。该设计在全局语境整合与快速状态累积之间交替,实现对长输入的高效训练与推理。为稳定可变长度批处理,我们引入填充安全掩码,阻断填充位置的状态传播;并引入掩码感知注意力池化,仅聚合有效token的信息。在GLUE基准上,MaBERT在八个任务中五个任务实现最佳均分,CoLA和句子对推理任务表现尤佳。当上下文长度从512扩展至4096时,MaBERT相较于编码器基线平均训练时间和推理延迟分别降低2.36倍和2.43倍,证明其实用且高效的长上下文编码器。
关键词
引用
@article{arxiv.2603.03001,
title = {MaBERT:A Padding Safe Interleaved Transformer Mamba Hybrid Encoder for Efficient Extended Context Masked Language Modeling},
author = {Jinwoong Kim and Sangjin Park},
journal= {arXiv preprint arXiv:2603.03001},
year = {2026}
}
备注
8 pages