中文

直接多 token 解码

计算与语言 2025-10-15 v1 人工智能

摘要

仅解码器 Transformer 已成为大语言模型(LLM)的标准架构,因其性能强大而广受青睐。近期研究表明,在预训练的 LLM 中,早期、中期和晚期层可能承担不同的角色:早期层专注于理解输入上下文,中期层处理任务特定的加工,而晚期层则将抽象表示转换为输出 token。我们假设,一旦表示经过早期和中期层处理,所得的隐藏状态可能已包含足够的信息,从而仅使用晚期层即可支持多个 token 的生成,无需反复穿越早期和中期层。我们将这种推理范式称为直接多 token 解码(DMTD)。与推测解码不同,我们的方法不引入额外的参数、辅助流程或生成后验证。尽管仅在有限数据集上进行了训练,经过微调的 DMTD Qwen3-4B 模型已展现出令人瞩目的成果,在性能仅有微小损失的情况下实现了最高 2 倍的加速。此外,正如我们的扩展性分析所示,其性能有望随着训练数据集规模的扩大而进一步提升。

关键词

引用

@article{arxiv.2510.11958,
  title  = {Direct Multi-Token Decoding},
  author = {Xuan Luo and Weizhi Wang and Xifeng Yan},
  journal= {arXiv preprint arXiv:2510.11958},
  year   = {2025}
}