BEAR: 用于评估因果和掩码语言模型中关系知识的统一框架
计算与语言
2024-04-08 v1
摘要
知识探测用于评估语言模型(LM)在预训练期间是否成功学习了关系知识。探测是一种 inexpensive 的方法,用于比较不同规模和训练配置的 LM。然而,先前的方法依赖于预训练 LM 所使用的目标函数,因而仅适用于掩码或因果 LM,无法用于比较不同类型的 LM。为此,我们提出一种方法,利用 LM 内在的能力来估计给定文本陈述的对数似然值。我们仔细设计了一个包含 7,731 个实例(更大版本中为 40,916 个)的评估数据集,从中为每个关系事实生成备选陈述,其中一个是正确的。我们随后评估 LM 是否正确地将最高对数似然值分配给正确的陈述。我们对 22 个常见 LM 的实验评估显示,我们提出的框架 BEAR 可以有效地跨不同 LM 类型进行知识探测。我们发布了 BEAR 数据集及开源框架,以便将其提供给研究社区,以促进 LM 的评估和开发。
引用
@article{arxiv.2404.04113,
title = {BEAR: A Unified Framework for Evaluating Relational Knowledge in Causal and Masked Language Models},
author = {Jacek Wiland and Max Ploner and Alan Akbik},
journal= {arXiv preprint arXiv:2404.04113},
year = {2024}
}
备注
NAACL 2024