中文

大语言模型是可靠的评判者吗?关于 LLM 事实性评估能力的研究

计算与语言 2023-11-02 v1

摘要

近年来,大语言模型(LLMs)因其显著的新兴能力而备受关注,超越了早期语言模型的表现。LLM 一个尤其引人入胜的应用是作为各类生成模型所产生文本的评估者。在本研究中,我们深入探究 LLM 作为文本生成模型所生成摘要中事实一致性的可靠评估者的潜力。首先,我们提出了一种使用 LLM 进行事实性评估的创新方法,即采用单个 LLM 完成基于问答的事实性打分全过程。随后,我们考察了多种 LLM 在直接事实性打分中的效能,并将其与传统指标及人工标注进行基准比较。与最初预期相反,我们的结果表明事实性指标与人工评估之间缺乏显著相关性,具体而言对 GPT-4 和 PaLM-2 如此。仅在 GPT-3.5 的两个事实性子类别上观察到显著相关性。这些跨各类事实错误类别的一致发现表明,当前 LLM 准确衡量事实性的能力存在根本性局限。本版本更简洁地呈现了信息,同时保留了原文的主要观点和发现。

关键词

引用

@article{arxiv.2311.00681,
  title  = {Are Large Language Models Reliable Judges? A Study on the Factuality Evaluation Capabilities of LLMs},
  author = {Xue-Yong Fu and Md Tahmid Rahman Laskar and Cheng Chen and Shashi Bhushan TN},
  journal= {arXiv preprint arXiv:2311.00681},
  year   = {2023}
}

备注

accepted by Generation, Evaluation & Metrics (GEM) Workshop at EMNLP 2023