中文

Diver:基于跨度级互信息验证的大语言模型解码

计算与语言 2024-06-05 v1

摘要

大语言模型(LLM)在提供任务特定指令后,显示出适应各种任务的强大能力。然而,采用标准解码策略的LLM常常在输入偏离时表现不佳。直观上,合规的LLM输出应反映输入中存在的信息,这可以通过点互信息(PMI)得分来衡量。因此,我们提出了Diver,通过跨度级PMI验证来增强LLM解码。在推断过程中,Diver首先识别可能导致多个候选跨度的偏差步骤。随后,它通过评估如果生成这些候选跨度时输入的对数似然增益来计算PMI得分。最后,根据PMI重新排序的输出分布选择最优跨度。我们在各种下游任务上评估了该方法,实证结果表明,Diver在性能和通用性方面均显著优于现有解码方法。

关键词

引用

@article{arxiv.2406.02120,
  title  = {Diver: Large Language Model Decoding with Span-Level Mutual Information Verification},
  author = {Jinliang Lu and Chen Wang and Jiajun Zhang},
  journal= {arXiv preprint arXiv:2406.02120},
  year   = {2024}
}