中文

Pre³:实现确定性下推自动机以加速结构化 LLM 生成

计算与语言 2025-10-06 v1

摘要

大量的 LLM 应用需要高效的结构化生成,特别是针对 LR(1) 文法,以生成指定格式的输出(如 JSON)。现有方法主要将 LR(1) 文法解析为下推自动机(PDA),导致上下文相关 Token 处理的运行时执行开销,在大规模推理批次下尤其低效。为解决这些问题,我们提出 Pre³,利用确定性下推自动机(DPDA)来优化约束 LLM 解码效率。首先,通过在预处理阶段预计算前缀条件边,Pre³ 实现了提前边分析,从而使并行转移处理成为可能。其次,利用前缀条件边,Pre³ 引入了一种新方法,将 LR(1) 转移图转换为 DPDA,消除了运行时路径探索的需要,并以最小开销实现边转移。Pre³ 可以无缝集成到标准 LLM 推理框架中,在实验中将每个输出 Token 的处理时间(TPOT)降低了最多 40%,吞吐量提高了最多 36%。代码可在 https://github.com/ModelTC/lightllm 获取。

关键词

引用

@article{arxiv.2506.03887,
  title  = {Pre$^3$: Enabling Deterministic Pushdown Automata for Faster Structured LLM Generation},
  author = {Junyi Chen and Shihao Bai and Zaijun Wang and Siyu Wu and Chuheng Du and Hailong Yang and Ruihao Gong and Shengzhong Liu and Fan Wu and Guihai Chen},
  journal= {arXiv preprint arXiv:2506.03887},
  year   = {2025}
}

备注

Published as a conference paper at ACL 2025