深呼吸:通过哨兵标记增强大语言模型的语言建模
计算与语言
2026-03-23 v2
摘要
大型语言模型(LLM)在 various 任务中展现出巨大的潜力,成为人类生活中强大的工具。然而,基于 Transformer 的 LLM 在建模长期上下文时会因为减少计算开销而丢弃部分信息而出现性能下降。本文提出一种简单而有效的方法,使 LLM 能够“深呼吸”,鼓励其对离散文本块中包含的信息进行总结。具体而言,我们将文本分割为多个块,并在每个块的末尾插入特殊标记 <SR>。随后,我们修改注意力掩码,将块的信息整合到对应的 <SR> 标记中。这使得 LLM 能够不仅从历史上的单个标记,还从 <SR> 标记上获取信息,从而聚合块的语义信息。在语言建模和出域下游任务上的实验验证了我们方法的优越性。
引用
@article{arxiv.2406.10985,
title = {Taking a Deep Breath: Enhancing Language Modeling of Large Language Models with Sentinel Tokens},
author = {Weiyao Luo and Suncong Zheng and Heming Xia and Weikang Wang and Yan Lei and Tianyu Liu and Shuang Chen and Zhifang Sui},
journal= {arXiv preprint arXiv:2406.10985},
year = {2026}
}