中文

MiChao-HuaFen 1.0:面向领域专用大模型的专用预训练语料数据集

计算与语言 2023-09-27 v2 人工智能

摘要

随着深度学习技术的发展,GPT-4等通用大模型在各个领域展现出卓越的能力。然而,在医疗、法律和金融等领域,对高质量领域专用输出的需求依然存在。本文首先评估了现有的领域专用大模型并讨论了其局限性。为满足特定领域的需求,我们引入了专为新闻与政府行业定制的“MiChao-HuaFen 1.0”预训练语料数据集。该数据集来源于2022年公开可用的互联网数据,经过多轮清洗与处理以确保高质量与来源可靠,并支持持续稳定的更新。该数据集不仅支持中文垂直领域大模型的预训练,也有助于推动相关领域的深度学习研究与应用。

关键词

引用

@article{arxiv.2309.13079,
  title  = {MiChao-HuaFen 1.0: A Specialized Pre-trained Corpus Dataset for Domain-specific Large Models},
  author = {Yidong Liu and FuKai Shang and Fang Wang and Rui Xu and Jun Wang and Wei Li and Yao Li and Conghui He},
  journal= {arXiv preprint arXiv:2309.13079},
  year   = {2023}
}

备注

4 pages,2 figures