基于分段的GPT注意力掩码
计算与语言
2024-12-25 v1
摘要
现代语言模型(LMs)得以成功,很大程度上归功于掩码因果注意力,这是生成式预训练变换器(GPT)模型的核心。虽然GPT模型可以一次性处理整个用户提示,但因果掩码是按词逐个应用的,模拟生成过程。这在初始“填充”阶段施加了不必要的约束——该阶段模型处理输入提示并生成内部表示,直到生成任何输出词。本文中的注意力基于填充阶段已知的块结构进行掩码,随后在此之后采用常规的逐词自回归过程。例如,在典型聊天提示中,系统提示被视为一个块,用户提示被视为下一个块。这些块作为掩码的单位处理,以便每个块中第一个词以非因果方式访问该块后续词。然后,以常规的因果方式生成模型答案。这种分段方案不增加额外的计算开销。当将其集成到Llama和Qwen等模型时,始终实现了最佳性能。
引用
@article{arxiv.2412.18487,
title = {Segment-Based Attention Masking for GPTs},
author = {Shahar Katz and Liran Ringel and Yaniv Romano and Lior Wolf},
journal= {arXiv preprint arXiv:2412.18487},
year = {2024}
}