中文

大语言模型的训练数据

人工智能 2024-11-13 v1

摘要

2022 年,随着 ChatGPT 的发布,大规模语言模型获得了广泛关注。ChatGPT 不仅在参数量和预训练语料库规模上超越了先前的模型,还通过在大量高质量人工标注数据上微调实现了革命性的性能提升。这一进展使企业和研究机构认识到,构建更智能、更强大的模型依赖于丰富且高质量的数据集。因此,数据集的构建与优化已成为人工智能领域的关键焦点。本文总结了用于训练大规模语言模型的预训练和微调数据的现状,涵盖数据规模、收集方法、数据类型与特征、处理流程等方面,并概述了可用的开源数据集。

关键词

引用

@article{arxiv.2411.07715,
  title  = {Training Data for Large Language Model},
  author = {Yiming Ju and Huanhuan Ma},
  journal= {arXiv preprint arXiv:2411.07715},
  year   = {2024}
}

备注

in Chinese language