中文

叠加解码:单次自回归推理生成多个候选文本

计算与语言 2024-11-01 v6 机器学习

摘要

当今许多应用在用户输入时都会提供多个自动完成草稿,包括 GitHub 的代码补全、Gmail 的智能撰写以及 Apple 的消息智能建议。在底层,语言模型通过执行自回归推理过程来提供候选文本。因此,生成 kk 个候选文本需要执行 kk 次昂贵的语言模型。为缓解执行 kk 次推理 passes 的计算成本,我们提出了叠加解码(Superposed Decoding),一种新的解码算法,可在单次自回归推理 pass 的计算成本下生成 kk 个候选文本。我们通过将 kk 个候选文本中最近的 token 嵌入的叠加形式作为输入,喂给语言模型的下一解码步骤。每一步推理中,我们将 kk 个候选文本与 top-kk token 组合,生成 k2k^2 个新的候选文本,并缓存 kk 个最可能的选项,使用 n-gram 插值法在最小计算开销下过滤不连贯的生成结果。我们的实验表明,叠加解码生成的 kk 个候选文本在连贯性和事实性方面至少与 Nucleus Sampling 和 Greedy Decoding 相当,而且对于 k3k\ge3 时至少快 2.44×2.44\times。在计算标准化 setting 下,用户评估明显偏好叠加解码生成的文本而非 Nucleus Sampling。叠加解码还可以与其他解码策略结合,实现推理时间计算的普遍覆盖收益。代码及更多示例已开源于 https://github.com/RAIVNLab/SuperposedDecoding。

关键词

引用

@article{arxiv.2405.18400,
  title  = {Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass},
  author = {Ethan Shen and Alan Fan and Sarah M. Pratt and Jae Sung Park and Matthew Wallingford and Sham M. Kakade and Ari Holtzman and Ranjay Krishna and Ali Farhadi and Aditya Kusupati},
  journal= {arXiv preprint arXiv:2405.18400},
  year   = {2024}
}

备注

23 pages, 16 figures, accepted at NeurIPS 2024