中文

SsciBERT:面向社会科学文本的预训练语言模型

计算与语言 2022-11-28 v3

摘要

社会科学学术文献记录了人类文明并研究人类社会问题。随着其大规模增长,快速查找相关议题已有研究的需求已成为研究者的迫切诉求。先前研究如SciBERT表明,使用领域特定文本进行预训练可提升自然语言处理任务性能。然而,迄今为止尚无针对社会科学的预训练语言模型。有鉴于此,本研究提出一个基于社会科学引文索引 (SSCI) 期刊所发表摘要的预训练模型。这些模型已在GitHub (https://github.com/S-T-Full-Text-Knowledge-Mining/SSCI-BERT) 上提供,在社会科学文献的学科分类、摘要结构-功能识别与命名实体识别任务上展现出优异性能。

关键词

引用

@article{arxiv.2206.04510,
  title  = {SsciBERT: A Pre-trained Language Model for Social Science Texts},
  author = {Si Shen and Jiangfeng Liu and Litao Lin and Ying Huang and Lin Zhang and Chang Liu and Yutong Feng and Dongbo Wang},
  journal= {arXiv preprint arXiv:2206.04510},
  year   = {2022}
}

备注

24 pages,2 figures