GUMsley:评估 12 种英语体裁摘要中的实体显著性
计算与语言
2024-02-01 v1
摘要
随着自然语言处理模型越来越能够从连贯实体的角度而非字符串的角度理解文档,为每个文档获取最显著的实体不仅本身是一项重要的最终任务,而且对于信息检索(IR)和可控摘要等其他下游应用也至关重要。在本文中,我们提出并评估了 GUMsley,这是第一个覆盖 12 种英语文本体裁中所有命名和非命名显著实体的实体显著性数据集,并与实体类型、维基化链接和完整的共指消解标注对齐。我们提倡使用人工摘要对显著性进行严格定义,并基于源实体是否在摘要中被提及,证明了显著性评估具有很高的标注者间一致性。我们的评估显示,预训练的当前最优摘要模型和零样本大语言模型提示在捕获生成摘要中的显著实体方面表现不佳。我们还表明,为几种模型架构预测或提供显著实体可以提升性能,并通过缓解现有抽象式摘要中的实体幻觉问题,帮助生成更高质量的摘要。
引用
@article{arxiv.2401.17974,
title = {GUMsley: Evaluating Entity Salience in Summarization for 12 English Genres},
author = {Jessica Lin and Amir Zeldes},
journal= {arXiv preprint arXiv:2401.17974},
year = {2024}
}
备注
Camera-ready for EACL 2024