掩码增强自回归预测:MEAP —— 减少注意力以学习更多
计算与语言
2026-03-16 v3 机器学习
摘要
大型语言模型(LLM)被发现在准确检索关键信息方面存在困难。为此,我们提出了掩码增强自回归预测(Mask-Enhanced Autoregressive Prediction, MEAP),这是一种简单而有效的训练范式,通过无缝集成掩码语言模型(Masked Language Modeling, MLM)来增强后者在上下文检索方面的能力。具体而言,MEAP 首先随机掩码一小部分输入标记,然后直接使用 decoder-only Transformer 进行标准的自回归 next-token prediction。MEAP 无需双向注意力或 encoder-decoder 架构即可实现 MLM,在预训练或推理期间不增加额外计算开销。大量实验表明,MEAP 在关键信息检索和长程语境推理任务上显著优于 NTP,而在常识推理任务上表现相当或更好。MEAP 的优势也延伸到监督微调场景,其中在 lost-in-the-middle 情景下表现尤为突出,超越 NTP 11.77 个百分点。我们的分析表明,MEAP 的有效性源于其通过聚焦于较少的非掩码标记来促进注意力得分更具区分性,从而提高模型对任务相关信号的关注,同时减轻边缘上下文的影响。这些发现将 MEAP 定位为大型语言模型的有前景的训练范式。
引用
@article{arxiv.2502.07490,
title = {Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More},
author = {Xialie Zhuang and Zhikai Jia and Jianjin Li and Zhenyu Zhang and Li Shen and Zheng Cao and Shiwei Liu},
journal= {arXiv preprint arXiv:2502.07490},
year = {2026}
}
备注
17 pages,7 figures