中文

使自回归模型能够填充被遮盖的标记

机器学习 2025-02-12 v1 人工智能 计算与语言

摘要

历史上,大语言模型 (LLM) 的训练主要采用自回归 (autoregressive, AR) 或掩码语言建模 (masked language modeling, MLM) 目标,其中 AR 模型近年来占据主导地位。然而,AR 模型本质上无法实现掩码填充 (masked infilling),即在过去与未来上下文之间预测被遮盖的标记。相比之下,MLM 模型在训练和推理期间存在固有的计算效率问题,限制了其可扩展性。本工作引入 MARIA (Masked and Autoregressive Infilling Architecture),一种新颖方法,融合两者优势,实现业界最佳的掩码填充性能。MARIA 通过训练一个线性解码器,将预训练的 MLM 与 AR 模型的拼接隐藏状态作为输入。这种最小化的修改使 AR 模型能够进行填充,同时保留其在 KV 缓存方面的天然优势。我们的实验结果表明,MARIA 在掩码填充任务中显著优于现有方法,尤其是离散扩散模型。

关键词

引用

@article{arxiv.2502.06901,
  title  = {Enabling Autoregressive Models to Fill In Masked Tokens},
  author = {Daniel Israel and Aditya Grover and Guy Van den Broeck},
  journal= {arXiv preprint arXiv:2502.06901},
  year   = {2025}
}