中文

跨家族推测性预填充:用于训练自由的长上下文压缩

计算与语言 2026-03-16 v3

摘要

提示长度是 agentic 大型语言模型(LLM)工作流程中的主要瓶颈,重复的推理步骤和多调用循环导致巨大的预填充成本。最近的工作表明,注意力机制的 token 重要性估计可实现训练自由的提示压缩,但这假设存在与目标模型相同分词器的草稿模型。实际情况下,agentic 流水线经常使用没有更小同族草稿模型的模型。在本工作中,我们研究跨家族推测性预填充,即使用来自不同模型家族的轻量级草稿模型为来自不同家族的目标模型执行提示压缩。使用与先前工作相同的推测预填充机制,我们评估了多种跨家族草稿-目标组合,包括 Qwen、LLaMA 和 DeepSeek 模型。在广泛的任务中,我们发现尽管草稿模型和目标模型之间存在模型架构和分词器差异,基于注意力的 token 重要性估计仍能可靠地跨模型传递。跨模型的提示压缩在保持约 90%~100% 的全提示基线性能方面大致保持性能,并在某些情况下因去噪效应而略微提高准确率,同时显著降低首字延迟(TTFT)。这些结果表明,推测性预填充主要依赖于任务先验和语义结构,从而作为一种可通用的提示压缩基元。我们讨论了这些发现对 agentic 系统的含义,其中涉及重复的长上下文推理和异构模型堆栈,使跨模型提示压缩既必要又实用。

关键词

引用

@article{arxiv.2603.02631,
  title  = {Cross-Family Speculative Prefill: Training-Free Long-Context Compression with Small Draft Models},
  author = {Shubhangi Upasani and Ravi Shanker Raju and Bo Li and Mengmeng Ji and John Long and Chen Wu and Urmish Thakker and Guangtao Wang},
  journal= {arXiv preprint arXiv:2603.02631},
  year   = {2026}
}