MiChao-HuaFen 1.0:面向领域专用大模型的专用预训练语料数据集
计算与语言
2023-09-27 v2 人工智能
摘要
随着深度学习技术的发展,GPT-4等通用大模型在各个领域展现出卓越的能力。然而,在医疗、法律和金融等领域,对高质量领域专用输出的需求依然存在。本文首先评估了现有的领域专用大模型并讨论了其局限性。为满足特定领域的需求,我们引入了专为新闻与政府行业定制的“MiChao-HuaFen 1.0”预训练语料数据集。该数据集来源于2022年公开可用的互联网数据,经过多轮清洗与处理以确保高质量与来源可靠,并支持持续稳定的更新。该数据集不仅支持中文垂直领域大模型的预训练,也有助于推动相关领域的深度学习研究与应用。
引用
@article{arxiv.2309.13079,
title = {MiChao-HuaFen 1.0: A Specialized Pre-trained Corpus Dataset for Domain-specific Large Models},
author = {Yidong Liu and FuKai Shang and Fang Wang and Rui Xu and Jun Wang and Wei Li and Yao Li and Conghui He},
journal= {arXiv preprint arXiv:2309.13079},
year = {2023}
}
备注
4 pages,2 figures