摘要究竟有用与否?面向下游任务的文本摘要外在人工评估
计算与语言
2023-05-25 v1
摘要
自动化文本摘要的研究在很大程度上依赖于人工与自动评估。近期的人工评估工作主要采用内在评估方法,评判文本摘要的通用质量(如信息量与连贯性),而我们的工作聚焦于以外在方法评估文本摘要的实用性。我们精心设计了三种不同的下游任务用于摘要的外在人工评估,即问答、文本分类与文本相似度评估。我们利用系统排序与用户行为数据开展实验,以评估不同摘要模型的性能。我们发现,在依赖对文本整体判断的任务中摘要尤为有用,而在问答任务中效果较弱。结果表明,经微调模型生成的摘要在所有三项任务中的实用性一致性更高,因为根据所提出的外在指标,微调摘要系统的排序在各下游任务间较为接近。然而,零样本设定下模型生成的摘要因其概括且细节较少的摘要风格,被发现偏向于文本分类与相似度评估任务。我们进一步评估了14种内在自动指标与人工标准的相关性,并表明内在自动指标在评估问答任务中摘要的实用性方面表现良好,但在另两项任务中效果较弱。这凸显了仅依赖内在自动指标评估摘要性能与实用性的局限性。
引用
@article{arxiv.2305.15044,
title = {Is Summary Useful or Not? An Extrinsic Human Evaluation of Text Summaries on Downstream Tasks},
author = {Xiao Pu and Mingqi Gao and Xiaojun Wan},
journal= {arXiv preprint arXiv:2305.15044},
year = {2023}
}