中文

CSL:一个大规模中文科学文献数据集

计算与语言 2022-09-13 v1

摘要

科学文献作为高质量语料库,支撑了大量自然语言处理(NLP)研究。然而,现有数据集以英语为中心,限制了中国科学 NLP 的发展。本工作中,我们提出 CSL,一个大规模中文科学文献数据集,包含 39.6 万篇论文的标题、摘要、关键词和学科领域。据我们所知,CSL 是首个中文科学文档数据集。CSL 可作为中文语料库。此外,该半结构化数据是一种自然标注,可构成许多有监督 NLP 任务。基于 CSL,我们提出一个基准来评估模型在科学领域任务上的性能,即摘要生成、关键词生成和文本分类。我们分析了现有文本到文本模型在评测任务上的表现,揭示了中文科学 NLP 任务的挑战,为未来研究提供了有价值的参考。数据和代码可在 https://github.com/ydli-ai/CSL 获取。

关键词

引用

@article{arxiv.2209.05034,
  title  = {CSL: A Large-scale Chinese Scientific Literature Dataset},
  author = {Yudong Li and Yuqing Zhang and Zhe Zhao and Linlin Shen and Weijie Liu and Weiquan Mao and Hui Zhang},
  journal= {arXiv preprint arXiv:2209.05034},
  year   = {2022}
}

备注

to be published in COLING 2022