中文

TokenSwift:超长序列生成的无损加速方法

计算与语言 2025-07-10 v2

摘要

使用大语言模型(LLMs)生成超长序列已成为 increasingly crucial 的任务,但仍然是 highly time-intensive 的,尤其是对于最长可达 10 万 token 的序列。虽然传统的 speculative 解码方法存在,但仅简单地扩展其生成限制并不能加速进程,反而可能适得其反。通过深入分析,我们识别出三大主要挑战限制了有效生成:频繁的模型重新加载、动态的 key-value(KV) 管理以及重复生成。为解决这些问题,我们引入 TOKENSWIFT,一种新型框架旨在在保持目标模型固有质量的前提下,大幅加速超长序列的生成过程。实验结果表明,TOKENSWIFT 在不同规模(1.5B、7B、8B、14B)和架构(MHA、GQA)的模型上实现了 3 倍以上的加速。这一加速 translates 到数小时的时间节省,使 TOKENSWIFT 成为前所未有长度下可扩展且有效的解决方案。代码可在 https://github.com/bigai-nlco/TokenSwift 查找。

关键词

引用

@article{arxiv.2502.18890,
  title  = {TokenSwift: Lossless Acceleration of Ultra Long Sequence Generation},
  author = {Tong Wu and Junzhe Shen and Zixia Jia and Yuxuan Wang and Zilong Zheng},
  journal= {arXiv preprint arXiv:2502.18890},
  year   = {2025}
}

备注

Accepted By ICML25