SIFiD:重新评估基于 LLM 的摘要事实不一致检测
计算与语言
2024-03-13 v1 机器学习
摘要
确保摘要与原始文档之间的事实一致性是摘要任务中至关重要的因素。因此,大量工作致力于检测不一致性。随着大型语言模型(LLM)的出现,近期研究开始利用其先进的语言理解能力进行不一致检测。然而,早期尝试显示,LLM由于指令遵循能力有限且缺乏有效的检测方法,表现不如传统模型。在本研究中,我们重新评估了基于LLM的摘要不一致检测,比较了GPT-3.5和GPT-4的性能。为推动LLM-based不一致检测的研究,我们提出了SIFiD(Summary Inconsistency Detection with Filtered Document),通过采用自然语言推理或衡量摘要与文档之间的语义相似性来识别文档中的关键句子。
引用
@article{arxiv.2403.07557,
title = {SIFiD: Reassess Summary Factual Inconsistency Detection with LLM},
author = {Jiuding Yang and Hui Liu and Weidong Guo and Zhuwei Rao and Yu Xu and Di Niu},
journal= {arXiv preprint arXiv:2403.07557},
year = {2024}
}