中文

Copy-as-Decode:基于判别性文本表示的 LLM 编辑语法约束并行预填

计算与语言 2026-05-26 v2 人工智能

摘要

LLMs 通过自回归方式完整再生输出来进行文本和代码编辑,即使大多数 token 在输入中原样出现。我们研究 Copy-as-Decode,将编辑生成重新构构为基于两种原始语法的结构化解码:<copy lines="i-j"/> 引用输入行范围,<gen>...</gen> 发射新内容。基于 token 级有限状态机确保语法有效性,serving 层原语通过单个并行预填前向更新每个 copy span 的 KV cache,而非 N 步自回归步骤——在 speculative decoding 的平行前向内核中共享,但以输入 token 为草稿并以程序强制接受取代概率验证。我们报告无需端到端训练的上限分析。(i)内核加速:在 Qwen2.5-{1.5B, 7B} 上,通过并行预填复制 N 个 token 速度为 6.8×--303×,快于自回归(N ∈ [8, 512],A100 80GB bf16)。(ii)Copy 限值:在 ProbeEdit 和 HumanEvalPack-Fix(Py/JS)上,74--98% 的金标准 token 在基于行级原语下可达;结合该语料库每个 span 直方图的经验内核,这导致闭形式 wall-clock 界限为 29.0× / 3.4× / 4.2×(13.0× 汇总)。基于 token 级扩展可达 91--99% 的覆盖率,4.5×--6.5× 的 floor。(iii)Pipeline 无损性:oracle 程序在所有 482 个案例中通过确定性解析器进行往返,使下游任何故障局限于 span 选择而非该机制。扰动研究显示,汇总 EM 在 off-by-one 噪声下从 100% 下降至 15.48%。在 Qwen2.5-Coder-1.5B 上进行的微调试点将 HEvalFix-Py EM 从 0/33(未训练)提升至 12--17%,这是一个可学习性信号,非生产选择器。批处理 serving 集成和多文件覆盖范围作为后续工作。

关键词

引用

@article{arxiv.2604.18170,
  title  = {Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing},
  author = {Ziyang Liu},
  journal= {arXiv preprint arXiv:2604.18170},
  year   = {2026}
}

备注

The authors have decided to withdraw this version following internal review regarding authorship and contribution agreements