中间可见:语言模型如何通过即插即用位置编码更好地利用长上下文
计算与语言
2024-03-11 v1 机器学习
摘要
本文旨在克服大语言模型(LLM)的“中间丢失”挑战。尽管最近的进展已成功使 LLM 能够对多达 400 万个 token 执行稳定的语言建模,但大多数 LLM 在识别位于上下文中间的相关信息时面临的持续困难尚未得到充分解决。为了解决这个问题,本文引入了多尺度位置编码(Ms-PoE),这是一种简单而有效的即插即用方法,可在无需微调或引入任何额外开销的情况下,增强 LLM 处理位于上下文中间的相关信息的能力。Ms-PoE 利用位置索引重缩放来缓解 RoPE 引入的长程衰减效应,同时精心地为不同的注意力头分配不同的缩放比例,以保留在预训练阶段学到的关键知识,从而形成从短距离到长距离的多尺度上下文融合。在多种 LLM 上进行的大量实验证明了我们方法的有效性。值得注意的是,在 Zero-SCROLLS 基准测试中,Ms-PoE 在原始 LLM 上实现了高达 3.8 的平均准确率提升。代码可在 https://github.com/VITA-Group/Ms-PoE 获取。
引用
@article{arxiv.2403.04797,
title = {Found in the Middle: How Language Models Use Long Contexts Better via Plug-and-Play Positional Encoding},
author = {Zhenyu Zhang and Runjin Chen and Shiwei Liu and Zhewei Yao and Olatunji Ruwase and Beidi Chen and Xiaoxia Wu and Zhangyang Wang},
journal= {arXiv preprint arXiv:2403.04797},
year = {2024}
}