中文

GujiBERT与GujiGPT:面向古籍的智能信息处理基础语言模型构建

计算与语言 2023-07-12 v1

摘要

在大型语言模型快速发展的背景下,我们精心训练并推出了GujiBERT和GujiGPT语言模型,它们是专为古籍智能信息处理而设计的基础模型。这些模型在一个涵盖简体与繁体中文的广泛数据集上训练,使它们能有效处理与古籍相关的各类自然语言处理任务,包括但不限于自动断句、标点、分词、词性标注、实体识别和自动翻译。值得注意的是,这些模型在使用公开数据集的一系列验证任务中表现出卓越性能。我们的研究结果凸显了采用自监督方法利用经典文本语料进一步训练模型从而增强其处理下游任务能力的有效性。此外,值得强调的是,字体选择、语料规模与初始模型选择均对最终实验结果产生显著影响。为满足数字人文与语言学研究者多样的文本处理偏好,我们开发了三类共计九种模型变体。我们相信,通过共享这些专攻古籍领域的基础语言模型,能够促进古籍的智能处理与学术探究,并进而有助于在新的时代全球传播中国丰富且受尊崇的传统文化。

关键词

引用

@article{arxiv.2307.05354,
  title  = {GujiBERT and GujiGPT: Construction of Intelligent Information Processing Foundation Language Models for Ancient Texts},
  author = {Dongbo Wang and Chang Liu and Zhixiao Zhao and Si Shen and Liu Liu and Bin Li and Haotian Hu and Mengcheng Wu and Litao Lin and Xue Zhao and Xiyu Wang},
  journal= {arXiv preprint arXiv:2307.05354},
  year   = {2023}
}

备注

22pages,0 figure