CNewSum: 带人工标注充分性与可推导性层级的大规模中文新闻摘要数据集
计算与语言
2021-10-22 v1
摘要
自动文本摘要旨在为输入文档生成简洁而关键的摘要。近年来,抽取式与生成式方法在英语数据集上均取得巨大成功。然而,受限于大规模数据集的缺乏,中文文本摘要的探索极为有限。本文提出大规模中文新闻摘要数据集 CNewSum,其包含 304,307 篇文档及对应人工撰写的新闻摘要。它具有长文档与高抽象性摘要,可促使当前摘要模型进行文档级理解与生成。CNewSum 的另一区分性特征是测试集含有摘要的充分性与可推导性标注。充分性层级度量文档对摘要信息的覆盖程度,可推导性指示模型生成摘要所需的推理能力。这些标注可帮助研究者分析并定位其模型性能瓶颈。我们在 CNewSum 上考察了近期方法,并发布数据集以为中文自动摘要研究提供坚实测试平台。
引用
@article{arxiv.2110.10874,
title = {CNewSum: A Large-scale Chinese News Summarization Dataset with Human-annotated Adequacy and Deducibility Level},
author = {Danqing Wang and Jiaze Chen and Xianze Wu and Hao Zhou and Lei Li},
journal= {arXiv preprint arXiv:2110.10874},
year = {2021}
}