大语言模型时代摘要的事实一致性评估
计算与语言
2025-02-28 v2
摘要
自动生成摘要与源文档的事实不一致可能导致错误信息或带来风险。现有的事实一致性(FC)指标受限于其性能、效率和可解释性。大语言模型(LLMs)的最新进展在文本评估中展现出了显著潜力,但其在评估摘要 FC 方面的有效性仍有待探索。先前的研究主要集中在专有 LLMs 上,未探索影响其评估能力的关键因素。此外,当前的 FC 评估基准仅限于新闻文章,令人对在这些基准上测试的 FC 方法的通用性产生怀疑。在本文中,我们首先通过引入 TreatFact 来填补这一空白,这是一个由临床文本的 LLM 生成摘要组成、并由领域专家标注了 FC 的数据集。此外,我们在新闻和临床领域对 11 个 LLM 进行了 FC 评估基准测试,并分析了模型大小、提示词、预训练和微调数据的影响。我们的研究结果表明,尽管专有模型在该任务上表现优异,但开源 LLMs 仍落后。然而,通过增大模型规模、扩展预训练数据以及开发精心整理的微调数据,有望提升开源 LLMs 的性能。在 TreatFact 上的实验表明,以往的方法和基于 LLM 的评估器均无法捕捉临床摘要中的事实不一致,这为 FC 评估提出了新的挑战。
引用
@article{arxiv.2402.13758,
title = {Factual consistency evaluation of summarization in the Era of large language models},
author = {Zheheng Luo and Qianqian Xie and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2402.13758},
year = {2025}
}
备注
published on ESWA