中文

面向语言模型事实性评估的基准生成

计算与语言 2024-02-06 v2 人工智能

摘要

在特定领域内部署语言模型(LM)之前,衡量其在该领域生成事实不正确信息的倾向十分重要。现有的 LLM 生成事实性评估方法侧重于从 LM 自身采样的事实,因而无法控制被评估事实的集合,且可能低估领域特定或罕见事实的代表性。我们提出 FACTOR:通过语料库变换的事实评估(Factual Assessment via Corpus TransfORmation),一种用于评估 LM 事实性的可扩展方法。FACTOR 自动将感兴趣的事实语料库转换为一项基准,用于评估 LM 从该语料库生成真实事实相对于相似但错误陈述的倾向。我们利用框架创建了三个基准:Wiki-FACTOR、News-FACTOR 与 Expert-FACTOR。我们表明:(i)我们的基准分数随模型规模增大而提高,并在 LM 引入检索增强后得以改善;(ii)基准分数与困惑度在模型排序上并非总是一致;(iii)当困惑度与基准分数不一致时,后者更好地反映了开放式生成中的事实性,正如人类标注者所衡量的那样。我们在 https://github.com/AI21Labs/factor 公开提供数据与代码。

关键词

引用

@article{arxiv.2307.06908,
  title  = {Generating Benchmarks for Factuality Evaluation of Language Models},
  author = {Dor Muhlgay and Ori Ram and Inbal Magar and Yoav Levine and Nir Ratner and Yonatan Belinkov and Omri Abend and Kevin Leyton-Brown and Amnon Shashua and Yoav Shoham},
  journal= {arXiv preprint arXiv:2307.06908},
  year   = {2024}
}