中文

TIDE:基于标记信息的深度执行用于 LLM 推理中的逐标记早期退出

机器学习 2026-03-24 v1 计算与语言

摘要

大型语言模型在推理时会将每个标记都通过所有层,无论其难易程度如何。我们提出 TIDE,一个基于无监督学习的后训练系统,通过在定期检查点层附加微小的学习路由器,在推理时选择每个标记所收敛的最早层。TIDE 无需模型重新训练,支持任何 HuggingFace 因果语言模型,自动检测 GPU 架构,支持 float32、float16 和 bfloat16 经过融合 CUDA 内核。在 NVIDIA A100 上使用 DeepSeek R1 Distill 8B,TIDE 实现 100% 的预填退出率(5% 的标记在第 11 层退出,其余在第 31 层),将预填延迟降低 7.2%,提升单批处理吞吐量 6.6%。在自回归解码期间,98-99% 的标记提前退出,同时模型以 95 个唯一输出标记的形式正确解决多步数学问题。在 Qwen3 8B(36 层)上,吞吐量在 batch size=8 时提升 8.1%。在 2000 个 WikiText 样本上的校准耗时不足 3分钟,生成约 4 MB 的路由器检查点。该系统包含 1308 行 Python 代码和 1081 行 CUDA/C++ 代码,经过 74 个通过测试。代码:https://github.com/RightNow-AI/TIDE

关键词

引用

@article{arxiv.2603.21365,
  title  = {TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference},
  author = {Jaber Jaber and Osama Jaber},
  journal= {arXiv preprint arXiv:2603.21365},
  year   = {2026}
}

备注

9 pages, 5 tables, 2 figures. Code: https://github.com/RightNow-AI/TIDE