GUM-SAGE:用于分级实体显著性预测的新型数据集与方法
计算与语言
2025-06-02 v2
摘要
确定并排序文本中最显著的实体对于用户面向系统至关重要,尤其是当用户越来越依赖模型来解释他们只部分阅读的长文档时。这一问题通过为实体分配反映其在文本中相对重要性的分数来解决,称为分级实体显著性。现有方法主要分为两类:一种是主观判断的显著性评分,允许梯度评分但缺乏一致性;另一种是基于摘要的方法,将显著性定义为摘要中是否值得被提及,从而促进可解释性,但仅能输出二元标签(实体要么是摘要 worthy,要么不值得)。本文提出了一种新的分级实体显著性方法,结合了两种方法的优势。我们使用覆盖12种言语和书面体裁的英文数据集,收集每个文档的5个摘要,并计算每个实体在这些摘要中出现的频率,以确定其显著性得分。我们的做法与基于人类摘要和对齐的得分具有更强的相关性,并优于现有技术,包括大语言模型。我们在https://github.com/jl908069/gum_sum_salience上发布了数据和代码,以支持进一步的分级显著实体提取研究。
引用
@article{arxiv.2504.10792,
title = {GUM-SAGE: A Novel Dataset and Approach for Graded Entity Salience Prediction},
author = {Jessica Lin and Amir Zeldes},
journal= {arXiv preprint arXiv:2504.10792},
year = {2025}
}
备注
Camera-ready for ACL Findings 2025