通过少样本提示实现互联网增强的语言模型用于开放域问答
计算与语言
2022-05-24 v2 机器学习
摘要
本工作中,我们旨在利用大规模语言模型(LSLM)独特的少样本能力,克服其在基于事实和最新信息接地方面的一些挑战。受半参数语言模型(LM)的启发——其决策基于外部检索证据——我们使用少样本提示来学习以从 Google Search(一个广泛且持续更新的知识源)返回的网络信息为条件对 LM 进行条件化。我们的方法不涉及微调或学习额外参数,因此适用于任何 LM,从而提供了强基线。事实上,我们发现以网络为条件的 LM 在开放域问答中超越了相似甚至更大模型规模的闭卷模型性能。最后,我们发现增加模型的推理时计算量——通过利用多个检索证据生成多个答案,随后使用由同一 LM 生成的分数进行重排序阶段实现——可带来更好性能,并缓解较小少样本 LM 的较低性能。总而言之,我们的发现表明,放缓迈向最大模型的竞赛、转而关注寻找更有效的模型使用方式(包括但不限于更好的提示或增加推理时计算量)可能是有益的。
引用
@article{arxiv.2203.05115,
title = {Internet-augmented language models through few-shot prompting for open-domain question answering},
author = {Angeliki Lazaridou and Elena Gribovskaya and Wojciech Stokowiec and Nikolai Grigorev},
journal= {arXiv preprint arXiv:2203.05115},
year = {2022}
}