中文

一种无需训练的大语言模型长度外推方法:贪婪注意力逻辑值插值(GALI)

计算与语言 2025-06-02 v2 人工智能

摘要

基于Transformer的大语言模型(LLMs)在处理超出其训练上下文窗口的输入时,会因位置分布外问题导致注意力机制紊乱而表现不佳。现有的解决方案,包括微调和无需训练的方法,面临着效率低下、冗余插值、逻辑值异常值或局部位置信息丢失等挑战。我们提出了贪婪注意力逻辑值插值(GALI),这是一种无需训练的方法,通过贪婪地重用预训练的位置区间并对注意力逻辑值进行插值以消除异常值,从而改善长度外推性能。GALI在广泛的长度上下文任务中实现了稳定且优越的性能,且无需针对特定输入长度进行调整。我们的分析进一步揭示,大语言模型对位置区间的解释是不均匀的,并且将插值限制在更窄的范围内可以提高性能,即使在短上下文任务上也是如此。GALI代表着向更鲁棒、更具泛化能力的大语言模型长文本处理迈出的一步。我们的GALI实现以及论文中的实验已在https://github.com/adlnlp/Gali开源。

关键词

引用

@article{arxiv.2502.02659,
  title  = {A Training-Free Length Extrapolation Approach for LLMs: Greedy Attention Logit Interpolation (GALI)},
  author = {Yan Li and Tianyi Zhang and Zechuan Li and Soyeon Caren Han},
  journal= {arXiv preprint arXiv:2502.02659},
  year   = {2025}
}

备注

9 pages, under review in the conference