中文

InfiniteHiP:在单块GPU上将语言模型上下文扩展至300万token

计算与语言 2025-02-14 v1 机器学习

摘要

在现代大型语言模型(LLM)中,处理非常长的上下文长度 presents significant挑战,因为这会导致推理速度变慢和内存成本增加。此外,大多数现有的预训练LLM无法超越其原始训练序列长度进行泛化。为实现高效和实用的长上下文利用,我们引入InfiniteHiP——一种新型且实用的LLM推理框架,通过模块化的分层token剪枝算法动态消除无关上下文token,以加速处理。我们的方法还允许对更长的序列进行泛化,通过根据LLM内部注意力模式有选择地应用各种RoPE调整方法。此外,我们在推理期间将key-value缓存卸载到主机内存,显著减轻GPU内存压力。结果表明,InfiniteHiP使单块L40s 48GB GPU能够处理最高300万token——扩大3倍——而不会永久性丢失上下文信息。该框架在100万token上下文中实现了18.95倍的注意力解码加速,无需额外训练。我们在SGLang框架中实现该方法,并通过广泛的评估展示其有效性和实用性。

关键词

引用

@article{arxiv.2502.08910,
  title  = {InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU},
  author = {Heejun Lee and Geon Park and Jaduk Suh and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2502.08910},
  year   = {2025}
}

备注

21 pages