用大语言模型评估摘要的事实一致性
计算与语言
2023-10-13 v2
摘要
检测摘要中的事实错误一直是摘要研究中的重要且具挑战性的课题。受大语言模型(LLM)涌现能力的启发,我们探索通过直接提示 LLM 来评估摘要的事实一致性。我们提出一项全面的实证研究,以评估 LLM 作为事实一致性评判者的能力,包括(1)分析不同的 LLM,如 GPT 模型系列与 Flan-T5;(2)研究多种提示方法,包括普通提示、思维链提示以及应对长摘要的逐句提示方法;(3)在由多个摘要系统生成的多样化摘要上评估,范围从预 Transformer 方法到 SOTA 预训练模型。我们的实验表明,在所有设定下提示 LLM 均能超越以往最佳事实性系统,在不一致性检测的二分类准确率上最高提升 12.2 个绝对百分点。
引用
@article{arxiv.2305.14069,
title = {Evaluating Factual Consistency of Summaries with Large Language Models},
author = {Shiqi Chen and Siyang Gao and Junxian He},
journal= {arXiv preprint arXiv:2305.14069},
year = {2023}
}