中文

迷失在推理中:重新发现自然语言推理对大语言模型的作用

计算与语言 2024-11-22 v1

摘要

在最近的过去,评估自然语言理解(NLU)的一种流行方式是考虑模型执行自然语言推理(NLI)任务的能力。在本文中,我们研究了很少用于大语言模型(LLM)评估的NLI任务是否仍然可以为评估LLM提供信息。我们聚焦于五个不同的NLI基准测试,跨越六个不同规模的模型,研究它们是否能够区分不同大小和质量的模型,以及它们的准确率在训练过程中如何发展。此外,我们研究了在陈述模糊或含糊的情况下,模型的softmax分布在多大程度上与人类分布一致。总体而言,我们的结果为NLI任务描绘了一幅积极的图景:我们发现它们能够在训练的不同阶段很好地区分模型,但并非(全部)饱和。此外,我们发现,虽然模型分布与人类标签分布的相似性随规模增加而增加,但它仍然远高于两个人类群体之间的相似性,这使其成为一个可能值得关注的统计量。

关键词

引用

@article{arxiv.2411.14103,
  title  = {Lost in Inference: Rediscovering the Role of Natural Language Inference for Large Language Models},
  author = {Lovish Madaan and David Esiobu and Pontus Stenetorp and Barbara Plank and Dieuwke Hupkes},
  journal= {arXiv preprint arXiv:2411.14103},
  year   = {2024}
}

备注

preprint, 13 pages