面向大语言模型生成与归因的最近邻推测解码
计算与语言
2025-04-28 v3
摘要
大语言模型(LLM)经常产生幻觉,且缺乏为其生成内容提供归因的能力。半参数化语言模型(如kNN-LM)通过利用非参数化数据存储中的最近邻匹配来优化给定提示下LM的输出,从而缓解这些局限。然而,这些模型通常推理速度慢,且生成文本不流畅。本文提出最近邻推测解码(NEST),一种新型半参数化语言建模方法,能够将任意长度的真实文本片段融入LM生成,并提供其来源归因。NEST在每个推理步骤执行词元级检索,计算半参数化混合分布,并在语料库中识别有前景的片段延续。然后使用近似推测解码过程,接受检索片段的前缀或生成新词元。NEST在多种知识密集型任务上显著提升了基础LM的生成质量和归因率,超越了传统kNN-LM方法,并与上下文检索增强方法性能相当。此外,NEST大幅提高了生成速度,应用于Llama-2-Chat 70B时推理时间加速1.8倍。代码将发布在https://github.com/facebookresearch/NEST/tree/main。
引用
@article{arxiv.2405.19325,
title = {Nearest Neighbor Speculative Decoding for LLM Generation and Attribution},
author = {Minghan Li and Xilun Chen and Ari Holtzman and Beidi Chen and Jimmy Lin and Wen-tau Yih and Xi Victoria Lin},
journal= {arXiv preprint arXiv:2405.19325},
year = {2025}
}