探索公共微调数据集:从数据构建视角看当前实践的复杂综述
计算与语言
2024-07-12 v1
摘要
随着大型模型领域的快速发展,与微调相关的研究也取得了显著进展,因为微调是大规模模型训练过程中的一个组成部分。数据工程在模型训练过程中发挥着根本作用,包括数据基础设施、数据处理等。微调过程中的数据构成了大型模型的基础。为了把握微调数据集的强大力量并探索新的可能性,本文从数据构建的角度综述当前的公共微调数据集。本综述从两个维度概述公共微调数据集:演化和分类,旨在描绘发展轨迹。大型语言模型 (LLM) 的公共微调数据集的构建技术和方法详述,包括数据生成和数据增强等。此阐述遵循上述分类,具体包括示范、比较和通用型类别。此外,我们在综述中抽象出数据生成技术的分类树,以帮助研究人员从构建维度更深入地理解微调数据集。我们的综述还总结了当前实践在不同数据准备阶段的构建特征,旨在提供全面概述并为未来研究提供指导。我们的综述还从构建视角讨论了涉及各种数据模态的微调数据集实践。文章最后,我们提供了有关微调数据集未来构建和发展的见解和考虑因素。
引用
@article{arxiv.2407.08475,
title = {Investigating Public Fine-Tuning Datasets: A Complex Review of Current Practices from a Construction Perspective},
author = {Runyuan Ma and Wei Li and Fukai Shang},
journal= {arXiv preprint arXiv:2407.08475},
year = {2024}
}