中文

评估大语言模型知识的可靠性

计算与语言 2023-10-17 v1

摘要

大语言模型(LLMs)因在知识探测任务中的强劲表现而被视为知识库。LLMs 通常使用准确率评估,然而该指标未能捕捉 LLMs 对提示与上下文变异性等诱发幻觉因素的脆弱性。我们如何评估 LLMs 持续产生事实正确回答的能力?本文中,我们提出 MOdel kNowledge relIabiliTy scORe (MONITOR),一种旨在直接度量 LLMs 事实可靠性的新颖指标。MONITOR 计算有效输出的概率分布与同一 LLM 使用不同风格提示和上下文探测同一事实所产生的对应输出之间的分布距离。在涵盖 12 个 LLMs 的广泛实验上,MONITOR 在评估 LLMs 事实可靠性方面表现出有效性,同时保持较低计算开销。此外,我们发布了 FKTC(事实知识测试语料)测试集,共包含 210,158 条提示,以促进该方向研究(https://github.com/Vicky-Wil/MONITOR)。

关键词

引用

@article{arxiv.2310.09820,
  title  = {Assessing the Reliability of Large Language Model Knowledge},
  author = {Weixuan Wang and Barry Haddow and Alexandra Birch and Wei Peng},
  journal= {arXiv preprint arXiv:2310.09820},
  year   = {2023}
}