中文

STORYSUMM:评估故事摘要的忠实性

人工智能 2025-04-02 v3 计算与语言

摘要

人工评估一直是检查抽象摘要忠实性的黄金标准。然而,对于像叙事这样具有挑战性的源领域,多个标注者可能一致认为某个摘要是忠实的,同时却遗漏了那些一旦被指出就显而易见的错误细节。因此,我们引入了一个新的数据集 STORYSUMM,其中包含带有局部忠实性标签和错误解释的短篇故事的 LLM 摘要。该基准用于评估方法,测试给定方法是否能检测到具有挑战性的不一致性。使用此数据集,我们首先表明任何一种人工标注协议都可能遗漏不一致性,并主张在建立摘要数据集的真实标准时应采用多种方法。最后,我们测试了最近的自动评估指标,发现它们在此任务上的平衡准确率均未超过 70%,这表明该数据集是未来忠实性评估工作中一个具有挑战性的基准。

关键词

引用

@article{arxiv.2407.06501,
  title  = {STORYSUMM: Evaluating Faithfulness in Story Summarization},
  author = {Melanie Subbiah and Faisal Ladhak and Akankshya Mishra and Griffin Adams and Lydia B. Chilton and Kathleen McKeown},
  journal= {arXiv preprint arXiv:2407.06501},
  year   = {2025}
}

备注

EMNLP Main 2024