CNTLS:一个用于抽取式或生成式中文时间线摘要的基准数据集
人工智能
2023-11-16 v2 信息检索
机器学习
摘要
时间线摘要(TLS)旨在利用来自大量新闻文章的带日期摘要,对长期事件进行总结。然而,数据的有限可用性显著减缓了时间线摘要的发展。本文中,我们介绍了CNTLS数据集,一个面向中文时间线摘要的多用途资源。CNTLS涵盖77个真实主题,每个主题含2524篇文档,并对所有主题平均实现了近60%的日期跨度压缩。我们使用知名指标对语料库进行了细致分析,重点关注摘要的风格与摘要任务的复杂度。具体而言,我们在CNTLS语料库上评估了多种抽取式与生成式摘要系统的性能,以提供基准并支持进一步研究。据我们所知,CNTLS是首个中文时间线摘要数据集。数据集与源代码已发布\footnote{代码与数据见:\emph{\url{https://github.com/OpenSUM/CNTLS}}。}。
引用
@article{arxiv.2105.14201,
title = {CNTLS: A Benchmark Dataset for Abstractive or Extractive Chinese Timeline Summarization},
author = {Qianren Mao and Jiazheng Wang and Zheng Wang and Xi Li and Bo Li and Jianxin Li},
journal= {arXiv preprint arXiv:2105.14201},
year = {2023}
}