短数据,长上下文:Transformer 中的位置知识蒸馏
计算与语言
2026-04-08 v1 机器学习
摘要
扩展语言模型的上下文窗口通常需要高昂的长上下文预训练,给训练效率和数据收集带来重大挑战。本文通过基于逻辑的知识蒸馏,证明即使仅在包含在长上下文窗口内的打包短上下文样本上进行训练,长上下文检索能力也能传递给学生模型。我们凭借旋转位置嵌入 (RoPE) 的视角提供了全面的见解,并确立了三个关键发现。首先,与先前工作一致,我们表明相位级 RoPE 缩放——即在每个训练阶段最大化旋转光谱利用率——也在知识蒸馏设置中实现最佳的长上下文性能。其次,我们证明基于逻辑的知识蒸馏可以直接实现位置信息的传递。使用包含打包重复标记序列的实验设置,我们追踪位置扰动从查询和键向量通过 successive transformer 层到输出逻辑的传播,揭示位置信息系统地影响教师的输出分布,从而影响学生模型接收到的蒸馏信号。最后,我们的分析发现查询状态在长上下文扩展期间存在结构化的更新模式,某些参数跨度对长上下文训练表现出强烈灵敏度。
引用
@article{arxiv.2604.06070,
title = {Short Data, Long Context: Distilling Positional Knowledge in Transformers},
author = {Patrick Huber and Ernie Chang and Chinnadhurai Sankar and Rylan Conway and Igor Fedorov and Md Rifat Arefin and Adithya Sagar},
journal= {arXiv preprint arXiv:2604.06070},
year = {2026}
}