大语言模型的训练数据
人工智能
2024-11-13 v1
摘要
2022 年,随着 ChatGPT 的发布,大规模语言模型获得了广泛关注。ChatGPT 不仅在参数量和预训练语料库规模上超越了先前的模型,还通过在大量高质量人工标注数据上微调实现了革命性的性能提升。这一进展使企业和研究机构认识到,构建更智能、更强大的模型依赖于丰富且高质量的数据集。因此,数据集的构建与优化已成为人工智能领域的关键焦点。本文总结了用于训练大规模语言模型的预训练和微调数据的现状,涵盖数据规模、收集方法、数据类型与特征、处理流程等方面,并概述了可用的开源数据集。
引用
@article{arxiv.2411.07715,
title = {Training Data for Large Language Model},
author = {Yiming Ju and Huanhuan Ma},
journal= {arXiv preprint arXiv:2411.07715},
year = {2024}
}
备注
in Chinese language