中文

ETT:扩展LLM测试时长上下文理解能力的方法

计算与语言 2025-10-23 v3

摘要

基于Transformer的语言模型的计算和存储开销随序列长度呈二次增长。这一二次成本在处理长序列时给LLM应用带来了挑战。本文引入一种名为\ourmodelacronym~(Extend at Test-Time)的方法,用于在常数内存要求下和线性计算开销下扩展短上下文Transformer-based LLM的上下文长度。ETT通过对输入上下文(划分为重叠的小子序列)进行有效微调模型参数来实现测试时期的上下文延长。我们在LongBench上评估ETT,将GPT-Large和Phi-2的上下文长度从1k扩展至32k,使模型准确率提高了最高30%。我们还研究了如何有效且高效地将上下文存储在LLM的权重中。通过详细的消融研究,我们检验哪些Transformer模块在测试时进行微调最为有益。意外地发现,对FFN第二层进行微调比完整微调更有效,进一步提高了模型的准确率。

关键词

引用

@article{arxiv.2507.06313,
  title  = {ETT: Expanding the Long Context Understanding Capability of LLMs at Test-Time},
  author = {Kiarash Zahirnia and Zahra Golpayegani and Walid Ahmed and Yang Liu},
  journal= {arXiv preprint arXiv:2507.06313},
  year   = {2025}
}