中文

Scratchpad Patching:在字节级语言模型中将计算与分块大小解耦

计算与语言 2026-05-12 v1 机器学习

摘要

无分词器语言模型通过直接在字节上操作来消除语言建模流程中的分词器步骤;基于分块的变体进一步将连续的字节跨度聚合成分块以提高效率。然而,在模型设计阶段选择的平均分块大小控制着一个紧密的权衡:更大的分块减少了计算量和 KV 缓存占用,但会降低建模质量。我们将这种权衡追溯到分块滞后:在一个分块被完全观测到之前,其中的字节预测必须依赖前一个分块的陈旧表示以保持因果性;随着分块变大,这种滞后会扩大。我们引入了 Scratchpad Patching(SP),它在每个分块内部插入瞬态暂存区,以聚合迄今为止看到的字节并刷新后续预测的分块级上下文。SP 使用下一字节预测熵来触发暂存区,选择性地将计算分配给信息密集的区域,并实现对推理时计算的事后调整。在自然语言和代码的实验中,SP 在相同分块大小下提高了模型质量;例如,即使在每分块 1616 字节的情况下,增强 SP 的模型在下游评估中也能匹配或接近字节级基线,同时在分块上使用 16×16\times 更小的 KV 缓存,并减少 33-4×4\times 的推理计算量。

关键词

引用

@article{arxiv.2605.09630,
  title  = {Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models},
  author = {Lin Zheng and Vasilisa Bashlovkina and Timothy Dozat and Dan Garrette and Laura Rimell and Joshua Maynez},
  journal= {arXiv preprint arXiv:2605.09630},
  year   = {2026}
}

备注

23 pages, 15 figures