SummExecEdit:基于可执行编辑的摘要事实一致性基准测试
计算与语言
2025-06-03 v2
摘要
检测摘要中的事实不一致性至关重要,但现有的基准测试缺乏稳健评估所需的挑战性和可解释性。在本文中,我们引入了 SummExecEdit,这是一种利用可执行编辑的新型流程和基准测试,用于评估模型检测事实错误和提供准确解释的能力。表现最好的模型 Claude3-Opus 在我们的基准测试中仅获得了 0.49 的检测与解释联合得分,其中检测单项得分为 0.67,解释单项得分为 0.73。我们进行了详细的评估以评估该领域模型的现状,并发现我们研究中 20 多个 LLM 中有超过一半难以处理 SummExecEdit 基准测试中 30% 以上的内容。此外,我们识别出四种主要的解释错误类型,其中 45.4% 的错误涉及将注意力集中在摘要中完全无关的部分。
引用
@article{arxiv.2412.13378,
title = {SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits},
author = {Onkar Thorat and Philippe Laban and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2412.13378},
year = {2025}
}