大语言模型的统计知识评估
计算与语言
2023-10-31 v2 机器学习
摘要
给定关于一个事实性问题的不同提示,大语言模型(LLM)能否可靠地生成事实正确的回答?现有的 LLM 可能针对不同的提示生成不同的响应。在本文中,我们研究量化 LLM 中关于给定事实集合所含知识的问题。我们提出 KaRR,一种用于评估 LLM 事实知识的统计方法。其主要思想是估计给定主体的多样提示和查询关系时,LLM 生成对应于答案实体的文本相对于随机机会生成的比例。我们的评估套件包含 994,123 个实体和 600 种关系的全面集合,具有 1,395,905 个文本别名。我们使用我们的方法评估了 20 个各种大小的 LLM,包括 LLaMA、Alpaca、OPT 等。实验表明,我们的结果与人针对 LLM 的评估结果具有强相关性(Kendall's 为 0.43)。我们的结果揭示,具有相同骨干架构的 LLM 中的知识遵循缩放定律,而在指令跟随数据上的调优有时会损害模型可靠生成事实正确文本的能力。
引用
@article{arxiv.2305.10519,
title = {Statistical Knowledge Assessment for Large Language Models},
author = {Qingxiu Dong and Jingjing Xu and Lingpeng Kong and Zhifang Sui and Lei Li},
journal= {arXiv preprint arXiv:2305.10519},
year = {2023}
}
备注
Accepted by NeurIPS 2023