CSL:一个大规模中文科学文献数据集
计算与语言
2022-09-13 v1
摘要
科学文献作为高质量语料库,支撑了大量自然语言处理(NLP)研究。然而,现有数据集以英语为中心,限制了中国科学 NLP 的发展。本工作中,我们提出 CSL,一个大规模中文科学文献数据集,包含 39.6 万篇论文的标题、摘要、关键词和学科领域。据我们所知,CSL 是首个中文科学文档数据集。CSL 可作为中文语料库。此外,该半结构化数据是一种自然标注,可构成许多有监督 NLP 任务。基于 CSL,我们提出一个基准来评估模型在科学领域任务上的性能,即摘要生成、关键词生成和文本分类。我们分析了现有文本到文本模型在评测任务上的表现,揭示了中文科学 NLP 任务的挑战,为未来研究提供了有价值的参考。数据和代码可在 https://github.com/ydli-ai/CSL 获取。
引用
@article{arxiv.2209.05034,
title = {CSL: A Large-scale Chinese Scientific Literature Dataset},
author = {Yudong Li and Yuqing Zhang and Zhe Zhao and Linlin Shen and Weijie Liu and Weiquan Mao and Hui Zhang},
journal= {arXiv preprint arXiv:2209.05034},
year = {2022}
}
备注
to be published in COLING 2022