中文

问题:大型语言模型在问答任务上表现如何?答案:

计算与语言 2024-12-18 v1

摘要

大型语言模型 (LLMs) 通过使用少样本或零样本提示技术,在无需针对这些任务进行显式训练的情况下,在各种 NLP 任务上展现出了可喜的成果。问答 (QA) 是一项常见的 NLP 任务。在本研究中,我们提出在 Stanford Question Answering Dataset 2.0 (SQuAD2) 上,对较小型的微调模型与开箱即用的指令遵循 LLMs 进行全面的性能比较,特别是在使用单次推理提示技术时。由于该数据集包含无法回答的问题,以往的工作使用了双重推理方法。我们提出了一种提示风格,旨在无需双重推理即可激发相同的能力,从而节省计算时间和资源。此外,我们通过比较它们在相似但不同的 QA 数据集上的表现来研究它们的泛化能力,在不微调任一模型的情况下,模拟现实世界中上下文和所提问题可能与原始训练分布不同的使用场景,例如将 Wikipedia 替换为新闻文章。我们的结果表明,较小型的微调模型在微调任务上优于当前的最先进 (SOTA) LLMs,但最近的 SOTA 模型能够在分布外测试中缩小这一差距,甚至在 5 个受测 QA 数据集中的 3 个上优于微调模型。

关键词

引用

@article{arxiv.2412.12893,
  title  = {Question: How do Large Language Models perform on the Question Answering tasks? Answer:},
  author = {Kevin Fischer and Darren Fürst and Sebastian Steindl and Jakob Lindner and Ulrich Schäfer},
  journal= {arXiv preprint arXiv:2412.12893},
  year   = {2024}
}

备注

Accepted at SAI Computing Conference 2025