EpiK-Eval:作为认知模型的语言模型评测
计算与语言
2024-02-26 v2 人工智能
摘要
在人工智能时代,大语言模型(LLMs)的角色正变得愈发核心。尽管其日益普及,它们从不同的训练文档中整合知识的能力——众多应用中的关键能力——仍未被探索。本文呈现首项考察 LLMs 在其参数空间内有效组合此类信息能力的研究。我们引入 EpiK-Eval,一种新颖的问答基准,专门评估 LLMs 从分段叙事中形成连贯且一致知识表示的能力。对多种 LLMs 的评估揭示了该领域的显著弱点。我们认为这些缺陷源于主流训练目标的内在本质。因此,我们主张改进知识整合的方法,因其蕴藏显著提升其整体效能与表现的潜力。本研究的发现为开发更稳健可靠的 LLMs 提供了见解。我们的代码与基准发布于 https://github.com/chandar-lab/EpiK-Eval
引用
@article{arxiv.2310.15372,
title = {EpiK-Eval: Evaluation for Language Models as Epistemic Models},
author = {Gabriele Prato and Jerry Huang and Prasannna Parthasarathi and Shagun Sodhani and Sarath Chandar},
journal= {arXiv preprint arXiv:2310.15372},
year = {2024}
}