中文

全面评估大语言模型的事实知识回忆能力

计算与语言 2024-04-26 v1 人工智能 机器学习

摘要

大语言模型(LLMs)在各种NLP任务上表现出色,并正在迅速被广泛应用于各种场景。因此,全面评估其生成输出的事实性至关重要,因为幻觉仍然是一个具有挑战性的问题。在这项工作中,我们专注于评估LLMs从预训练中回忆事实知识的能力以及影响这种能力的因素。为此,我们构建了FACT-BENCH,一个代表性基准,涵盖20个领域、134种属性类型、3种答案类型和不同的知识流行度水平。我们对来自10个模型家族的31个模型进行了基准测试,并全面评估了它们的优缺点。我们观察到,指令微调会损害知识回忆,因为仅预训练模型始终优于其指令微调版本;模型扩展具有积极影响,因为对于所有模型家族,更大的模型优于更小的模型。然而,GPT-4的最佳性能与上界之间仍存在较大差距。我们还使用反事实示例研究了上下文示例的作用,这导致大型模型的事实知识回忆显著下降。通过进一步解耦模型已知和未知知识,我们发现这种下降归因于与模型已知知识相矛盾的示例以及此类示例的数量。最后,我们在已知和未知知识的不同设置下微调了LLaMA-7B。特别地,在模型已知知识上进行微调是有益的,并且始终优于在未知和混合知识上的微调。我们将公开我们的基准。

关键词

引用

@article{arxiv.2404.16164,
  title  = {Towards a Holistic Evaluation of LLMs on Factual Knowledge Recall},
  author = {Jiaqing Yuan and Lin Pan and Chung-Wei Hang and Jiang Guo and Jiarong Jiang and Bonan Min and Patrick Ng and Zhiguo Wang},
  journal= {arXiv preprint arXiv:2404.16164},
  year   = {2024}
}