中文

kNN-Prompt:最近邻零样本推断

计算与语言 2022-11-03 v2

摘要

检索增强语言模型(LMs)利用非参数记忆,在基于困惑度的评测上大幅优于无检索的对应模型,但其在少样本和零样本末端任务准确率上是否能取得类似提升仍是一个开放问题。我们深入研究了其中一种模型——k近邻语言模型(kNN-LM),发现其增益仅边际迁移。主要挑战在于覆盖定义不同末端任务类标签的verbalizer词元。为应对该挑战,我们还提出了kNN-Prompt,一种简单有效的kNN-LM,具有自动扩展的模糊verbalizer(例如将terrible扩展为同时包含silly及其他面向情感分类的任务特定同义词)。在九个多样化末端任务上,将kNN-Prompt与GPT-2 large结合使用,相比强零样本基线取得了显著性能提升(平均比基础LM绝对提升13.4%)。我们还表明非参数增强的其他优势对末端任务同样成立;kNN-Prompt无需进一步训练即可有效用于领域自适应,且增益随检索模型规模增大而增加。

关键词

引用

@article{arxiv.2205.13792,
  title  = {kNN-Prompt: Nearest Neighbor Zero-Shot Inference},
  author = {Weijia Shi and Julian Michael and Suchin Gururangan and Luke Zettlemoyer},
  journal= {arXiv preprint arXiv:2205.13792},
  year   = {2022}
}