中文

通过外推巨型与假设性语言模型概率来解释与改进对比解码

计算与语言 2024-11-05 v1

摘要

对比解码(CD)(Li等,2023)使用小型业余语言模型(LM)改进大型专家语言模型(LM)的下一个标记分布。尽管CD已应用于各种LM和领域以增强开放式文本生成,但仍不清楚CD为何常常有效、何时可能失败以及如何使其更好。为深化对CD的理解,我们首先理论证明CD可被视为线性外推巨型假设性LM的下一个标记logit。我们还指出,线性外推可能使CD无法输出业余LM已赋予高概率的最显而易见的答案。为克服CD的局限性,我们提出一种新的无监督解码方法称为A\mathbf{A}symptotic P\mathbf{P}robability D\mathbf{D}ecoding(APD)。APD显式外推不同规模LM的概率曲线,以推断来自无限大LM的渐近概率,而无需增加推理成本。事实上,在FactualityPrompts上进行的实验表明,使用APD进行采样在可信度方面显著优于CD采样及其变体,达到Pythia 6.9B和OPT 6.7B的最先进结果。此外,在五个常识QA数据集中,APD通常优于CD, achieving类似使用更大LLM的效果。例如,Pythia 6.9B上APD的困惑度甚至低于Pythia 12B在CommonsenseQA和LAMBADA上的困惑度。

关键词

引用

@article{arxiv.2411.01610,
  title  = {Explaining and Improving Contrastive Decoding by Extrapolating the Probabilities of a Huge and Hypothetical LM},
  author = {Haw-Shiuan Chang and Nanyun Peng and Mohit Bansal and Anil Ramakrishna and Tagyoung Chung},
  journal= {arXiv preprint arXiv:2411.01610},
  year   = {2024}
}

备注

EMNLP 2024 Oral