FABLES:评估书籍长度摘要中的忠实性与内容选择
计算与语言
2024-10-01 v2 人工智能
摘要
虽然长上下文大语言模型(LLM)在技术上可以总结书籍长度的文档(超过10万词元),但文档的长度和复杂性迄今为止阻碍了对输入依赖方面(如忠实性)的评估。在本文中,我们首次对LLM生成的虚构书籍摘要进行了关于忠实性和内容选择的大规模人工评估。我们的研究通过聚焦于2023年或2024年出版的书籍摘要来减轻数据污染问题,并雇佣在注释任务前已完整阅读每本书的注释者,以最小化成本和认知负担。我们收集了FABLES数据集,该数据集包含对26本书的LLM生成摘要中3158个声明的注释,成本为5200美元,这使我们能够根据忠实性对LLM摘要器进行排名:Claude-3-Opus显著优于所有闭源LLM,而开源Mixtral与GPT-3.5-Turbo相当。对注释的分析显示,大多数不忠实的声明与事件和角色状态有关,并且通常需要通过对叙事的间接推理来证伪。虽然基于LLM的自动评分器在其他设置中已被证明对事实性和连贯性可靠,但我们实现了几个LLM忠实性评分器,发现没有一个与人工注释强相关,尤其是在检测不忠实声明方面。我们的实验表明,检测不忠实声明不仅是摘要评估的一个重要未来方向,也是长上下文理解的测试平台。最后,我们超越忠实性,探索了书籍长度摘要中的内容选择错误:我们开发了一个与关键叙事元素相关的遗漏错误类型学,并识别出对书籍结尾事件系统性的过度强调。
引用
@article{arxiv.2404.01261,
title = {FABLES: Evaluating faithfulness and content selection in book-length summarization},
author = {Yekyung Kim and Yapei Chang and Marzena Karpinska and Aparna Garimella and Varun Manjunatha and Kyle Lo and Tanya Goyal and Mohit Iyyer},
journal= {arXiv preprint arXiv:2404.01261},
year = {2024}
}
备注
preprint - 39 pages