GUMSum:面向英语抽取式摘要的多体裁数据与评测
计算与语言
2023-06-21 v1
摘要
基于预训练语言模型的自动摘要已产生令人印象深刻的流畅结果,但容易出现“幻觉”、在非新闻体裁上性能低下,以及输出并非严格意义上的摘要。针对ACL 2023的“现实检验”主题,我们提出GUMSum,一个规模小但精心构建的、涵盖12种书面与口语体裁的英语摘要数据集,用于评测抽取式摘要。摘要受到高度约束,聚焦于替代潜力、事实性与忠实性。我们给出标注指南,评估了人工一致性以及对近期系统输出的主观判断,将通用领域未调优方法、一种微调方法与一种基于提示的方法同人类表现进行比较。结果表明,尽管GPT3取得了令人印象深刻的分数,其仍逊于人类,且在不同体裁上质量参差不齐。人工判断揭示了有监督、提示生成及人工生成摘要中不同类型的错误,为产出优质摘要的挑战提供了启示。
引用
@article{arxiv.2306.11256,
title = {GUMSum: Multi-Genre Data and Evaluation for English Abstractive Summarization},
author = {Yang Janet Liu and Amir Zeldes},
journal= {arXiv preprint arXiv:2306.11256},
year = {2023}
}
备注
Accepted to the Findings of ACL 2023; camera-ready version