中文

EpiK-Eval:作为认知模型的语言模型评测

计算与语言 2024-02-26 v2 人工智能

摘要

在人工智能时代,大语言模型(LLMs)的角色正变得愈发核心。尽管其日益普及,它们从不同的训练文档中整合知识的能力——众多应用中的关键能力——仍未被探索。本文呈现首项考察 LLMs 在其参数空间内有效组合此类信息能力的研究。我们引入 EpiK-Eval,一种新颖的问答基准,专门评估 LLMs 从分段叙事中形成连贯且一致知识表示的能力。对多种 LLMs 的评估揭示了该领域的显著弱点。我们认为这些缺陷源于主流训练目标的内在本质。因此,我们主张改进知识整合的方法,因其蕴藏显著提升其整体效能与表现的潜力。本研究的发现为开发更稳健可靠的 LLMs 提供了见解。我们的代码与基准发布于 https://github.com/chandar-lab/EpiK-Eval

关键词

引用

@article{arxiv.2310.15372,
  title  = {EpiK-Eval: Evaluation for Language Models as Epistemic Models},
  author = {Gabriele Prato and Jerry Huang and Prasannna Parthasarathi and Shagun Sodhani and Sarath Chandar},
  journal= {arXiv preprint arXiv:2310.15372},
  year   = {2024}
}