中文

通过最长稳定前缀实现 DLMs 的快速一致推理

计算机视觉与模式识别 2026-03-06 v1

摘要

扩散语言模型(Diffusion Language Models, DLMs)承诺实现高度并行的文本生成,但实际推理速度往往受限于次优解码调度器。标准方法依赖“散列接受”——在序列中不连续位置提交高置信度 token——这种做法不可避免地破坏 Key-Value(KV)缓存,破坏内存局部性,并迫使模型在不稳定 token 边界上进行代价高昂的重复修复。为解决此问题,我们提出最长稳定前缀(Longest Stable Prefix, LSP)调度器,一种无需训练且模型无关的推理范式,基于单块吸收。每一步去噪中,LSP 通过单次前向传播评估 token 的稳定性,动态识别稳定预测的连续左对齐块,并在原子提交前将其边界锚定到自然语言或结构边界。这种前缀优先拓扑带来双重收益:系统层面,将碎片化的 KV 缓存更新转换为高效的连续追加;算法层面,保留对几何收缩的活后缀的双向前瞻,大幅减少 token 翻转率和去噪调用次数。对 LLaDA-8B 和 Dream-7B 进行大规模评估,表明 LSP 在包括数学推理、代码生成、多语言(CJK)任务和创意写作等严格基准上可实现最高 3.4 倍的加速,同时保持或略微提升输出质量。通过从根本上重构提交拓扑,LSP 弥合了 DLMs 理论并行性与实际硬件效率之间的鸿沟。

关键词

引用

@article{arxiv.2603.05454,
  title  = {Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes},
  author = {Pengxiang Li and Joey Tsai and Hongwei Xue and Kunyu Shi and Shilin Yan},
  journal= {arXiv preprint arXiv:2603.05454},
  year   = {2026}
}

备注

Accepted at ICLR 2026