中文

BBT-Fin:中文金融领域预训练语言模型、语料库与基准的综合构建

计算与语言 2023-02-28 v2

摘要

为了推动中文金融自然语言处理(NLP)的发展,我们引入了 BBT-FinT5,这是一个基于 T5 模型的新型中文金融预训练语言模型。为了支持这项工作,我们构建了 BBT-FinCorpus,这是一个大规模金融语料库,包含来自四个不同来源的约 300GB 原始文本。在通用领域 NLP 中,像 GLUE 和 SuperGLUE 这样的综合基准通过实现模型间的直接比较,极大地推动了语言模型预训练的进步。受这些基准的启发,我们提出了 BBT-CFLEB,一个中文金融语言理解与生成评估基准,它包含六个涵盖理解和生成任务的数据集。我们的目标是促进中文金融领域 NLP 的发展研究。我们的模型、语料库和基准已在 https://github.com/ssymmetry/BBT-FinCUGE-Applications 发布。我们的工作属于 Big Bang Transformer (BBT),一个大规模预训练语言模型项目。

关键词

引用

@article{arxiv.2302.09432,
  title  = {BBT-Fin: Comprehensive Construction of Chinese Financial Domain Pre-trained Language Model, Corpus and Benchmark},
  author = {Dakuan Lu and Hengkui Wu and Jiaqing Liang and Yipei Xu and Qianyu He and Yipeng Geng and Mengkun Han and Yingsi Xin and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2302.09432},
  year   = {2023}
}

备注

Changed author order