中文

用大语言模型评估摘要的事实一致性

计算与语言 2023-10-13 v2

摘要

检测摘要中的事实错误一直是摘要研究中的重要且具挑战性的课题。受大语言模型(LLM)涌现能力的启发,我们探索通过直接提示 LLM 来评估摘要的事实一致性。我们提出一项全面的实证研究,以评估 LLM 作为事实一致性评判者的能力,包括(1)分析不同的 LLM,如 GPT 模型系列与 Flan-T5;(2)研究多种提示方法,包括普通提示、思维链提示以及应对长摘要的逐句提示方法;(3)在由多个摘要系统生成的多样化摘要上评估,范围从预 Transformer 方法到 SOTA 预训练模型。我们的实验表明,在所有设定下提示 LLM 均能超越以往最佳事实性系统,在不一致性检测的二分类准确率上最高提升 12.2 个绝对百分点。

关键词

引用

@article{arxiv.2305.14069,
  title  = {Evaluating Factual Consistency of Summaries with Large Language Models},
  author = {Shiqi Chen and Siyang Gao and Junxian He},
  journal= {arXiv preprint arXiv:2305.14069},
  year   = {2023}
}